{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2REERM5RYU3SWPF3VPJ5PQHOQP","short_pith_number":"pith:2REERM5R","schema_version":"1.0","canonical_sha256":"d44848b3b1c5372b3cbbabd3d7c0ee83ef4e80315dd48de6614b88fd78b06013","source":{"kind":"arxiv","id":"2405.11165","version":4},"attestation_state":"computed","paper":{"title":"Automated Multi-level Preference for MLLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Fanglong Liu, Haocheng Feng, Huanjin Yao, Jianbo Zhao, Jingdong Wang, Kang Rong, Mengxi Zhang, Wenhao Wu, Yifan Sun, Yu Lu, Yuxin Song","submitted_at":"2024-05-18T03:49:37Z","abstract_excerpt":"Current multimodal Large Language Models (MLLMs) suffer from ``hallucination'', occasionally generating responses that are not grounded in the input images. To tackle this challenge, one promising path is to utilize reinforcement learning from human feedback (RLHF), which steers MLLMs towards learning superior responses while avoiding inferior ones. We rethink the common practice of using binary preferences (i.e., superior, inferior), and find that adopting multi-level preferences (e.g., superior, medium, inferior) is better for two benefits: 1) It narrows the gap between adjacent levels, ther"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.11165","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-05-18T03:49:37Z","cross_cats_sorted":[],"title_canon_sha256":"2d2361eafb62926a9700752e6d173d05e9e7450b278544c12e0561f9da06d565","abstract_canon_sha256":"e3d3c60edd299618e8f5b8d9735e6150ae0843247e302a9e343c204f82b9640c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:24:24.897560Z","signature_b64":"Zg7L+bONHON9JBIqWNZ1IhKl13lxEgSlkgBKiG/2c0nTQhU/4WFYEWki3gSd0J72GceL3GV93FDECzkEXQCICQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d44848b3b1c5372b3cbbabd3d7c0ee83ef4e80315dd48de6614b88fd78b06013","last_reissued_at":"2026-07-05T08:24:24.897106Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:24:24.897106Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Automated Multi-level Preference for MLLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Fanglong Liu, Haocheng Feng, Huanjin Yao, Jianbo Zhao, Jingdong Wang, Kang Rong, Mengxi Zhang, Wenhao Wu, Yifan Sun, Yu Lu, Yuxin Song","submitted_at":"2024-05-18T03:49:37Z","abstract_excerpt":"Current multimodal Large Language Models (MLLMs) suffer from ``hallucination'', occasionally generating responses that are not grounded in the input images. To tackle this challenge, one promising path is to utilize reinforcement learning from human feedback (RLHF), which steers MLLMs towards learning superior responses while avoiding inferior ones. We rethink the common practice of using binary preferences (i.e., superior, inferior), and find that adopting multi-level preferences (e.g., superior, medium, inferior) is better for two benefits: 1) It narrows the gap between adjacent levels, ther"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.11165","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.11165/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.11165","created_at":"2026-07-05T08:24:24.897171+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.11165v4","created_at":"2026-07-05T08:24:24.897171+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.11165","created_at":"2026-07-05T08:24:24.897171+00:00"},{"alias_kind":"pith_short_12","alias_value":"2REERM5RYU3S","created_at":"2026-07-05T08:24:24.897171+00:00"},{"alias_kind":"pith_short_16","alias_value":"2REERM5RYU3SWPF3","created_at":"2026-07-05T08:24:24.897171+00:00"},{"alias_kind":"pith_short_8","alias_value":"2REERM5R","created_at":"2026-07-05T08:24:24.897171+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP","json":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP.json","graph_json":"https://pith.science/api/pith-number/2REERM5RYU3SWPF3VPJ5PQHOQP/graph.json","events_json":"https://pith.science/api/pith-number/2REERM5RYU3SWPF3VPJ5PQHOQP/events.json","paper":"https://pith.science/paper/2REERM5R"},"agent_actions":{"view_html":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP","download_json":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP.json","view_paper":"https://pith.science/paper/2REERM5R","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.11165&json=true","fetch_graph":"https://pith.science/api/pith-number/2REERM5RYU3SWPF3VPJ5PQHOQP/graph.json","fetch_events":"https://pith.science/api/pith-number/2REERM5RYU3SWPF3VPJ5PQHOQP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP/action/storage_attestation","attest_author":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP/action/author_attestation","sign_citation":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP/action/citation_signature","submit_replication":"https://pith.science/pith/2REERM5RYU3SWPF3VPJ5PQHOQP/action/replication_record"}},"created_at":"2026-07-05T08:24:24.897171+00:00","updated_at":"2026-07-05T08:24:24.897171+00:00"}