{"as_of":"2026-08-10T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b522ec72e61c60fa7532db750b31a6a95e35e3a0fde1a7b708a765dd07506cf1","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:18:38.304903Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:29:33.614965Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:33:28.064115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"cited_work":{"arxiv_id":"2508.20181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20181","snapshot_observed_at":"2026-06-29T13:33:28.064115Z","title":null,"venue":null,"work_id":"83ad2f31-9327-4193-92fc-4ca333a3abf4","year":2025},"citing_paper":{"arxiv_id":"2605.27993","last_updated":"2026-05-27T05:33:06Z","snapshot_observed_at":"2026-08-09T14:15:09.757472Z","submitted_at":"2026-05-27T05:33:06Z","title":"Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T13:29:33.614965Z"},"links":{"cited_paper":"/paper/2508.20181","citing_paper":"/paper/2605.27993"},"observation_digest":"sha256:a6234e912b565c7100ae67df5059f7fecf1c03fd3bbfe737f85db4e16cd217ae","observation_id":"52162736-4518-4fe8-a41c-cfd720d0e08f","resolution":{"observed_at":"2026-06-29T13:33:28.065432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20181/citation-record","integrity":"/paper/2508.20181/integrity","json":"/paper/2508.20181/citation-record.json","paper":"/paper/2508.20181"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T15:18:33.237590Z","title":"Qwen-VL: A Versatile Vision-Language Model for Un- derstanding, Localization, Text Reading, and Beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.237590Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:09715845ee4c89a47660e131bbaae5da8bd59c54ebeaf92b68f637bf209bf1ae","observation_id":"86fa58ad-9fef-468b-8454-9981aceb40a5","resolution":{"observed_at":"2026-08-05T15:18:33.237590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-05T15:18:33.324613Z","title":"Hallucination of Multimodal Large Language Models: A Survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.324613Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:e45041f52ca8437832ee5d9713ebd29b86f26839acc94df7b83686f9386dd084","observation_id":"30c65b2a-8c2a-4420-9b05-6500010b9090","resolution":{"observed_at":"2026-08-05T15:18:33.324613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.559094Z","title":"With a Little Help from your own Past: Prototypical Memory Networks for Image Captioning","venue":null,"work_id":"28cd6fa4-6f11-44c6-b81f-2b5863c4439f","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.368982Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a76a3537e32070b751bb5fcfeaa7c912b4833e29424a07bee9d1e1be13de3139","observation_id":"4ae0cf45-190a-474b-87e3-2f62f86ec140","resolution":{"observed_at":"2026-08-05T15:18:46.651646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.349361Z","title":"The Revolution of Multimodal Large Language Models: A Survey","venue":null,"work_id":"44003167-cde5-45bd-82e6-ccbd3205e8e0","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.438837Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c870576eb7efaa2ae9c54bc10636153a16f5421d2785d3525982417e621501cf","observation_id":"1659d00d-a5ac-46c0-9207-c1b612038898","resolution":{"observed_at":"2026-08-05T15:18:46.443655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.213272Z","title":"End-to-End Object Detection with Transformers","venue":null,"work_id":"3e736034-6b3e-4297-9cb3-6baf84e03c92","year":2020},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.537393Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:20d2d5113ee30d7537acabfa025914e56fcec6e30b20960a1dd7c587c893816b","observation_id":"9bfb76dc-749f-4a03-abd1-e54c319ce65d","resolution":{"observed_at":"2026-08-05T15:18:46.285354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T15:18:33.646628Z","title":"Shikra: Unleashing Multimodal LLM’s Referential Dialogue Magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.646628Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:dd8f347a2f4a00592399e9f22248e3b1406b7f05bedd9ee39adcb183706fdea9","observation_id":"b9ab9a6f-c19c-4e72-832d-1e18dfcb6fda","resolution":{"observed_at":"2026-08-05T15:18:33.646628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.083628Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"132b8253-f7ed-4303-a0dd-4c5d14c59e34","year":null},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.725432Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:2330c82270f3d3c148c434693c8c5ba85bf5816e2594eb5e722fc415bc582120","observation_id":"de52eb4e-5928-4687-a62e-82d6be2a150c","resolution":{"observed_at":"2026-08-05T15:18:46.139959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.772722Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","venue":null,"work_id":"3000f700-f0c5-4814-9280-887033381aa6","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.892444Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:e7fda06dd39e3b3a624e0e0d8c670ae33d6787e3622b02882197cde6ce803b16","observation_id":"a864a7fd-65c0-4e08-a6ee-f8308d2cb009","resolution":{"observed_at":"2026-08-05T15:18:45.818209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.629708Z","title":"LLaV A-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning","venue":null,"work_id":"6643675b-838a-4db2-8bc6-704aa8ece94c","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.975071Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:39d09ce318be87e8ec2d50f7e0dfaaf4125661c97bf95416bc46f093491b9593","observation_id":"409edc50-62c0-4faf-b294-d9d658422371","resolution":{"observed_at":"2026-08-05T15:18:45.699335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T15:18:34.027368Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.027368Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9b1cce79c5b42894b0a3cb36ba9fd399d2abcdf64aa5a2157329f79e6c993c5f","observation_id":"85874f6f-1ea4-42e8-988f-1fd23bfac7d8","resolution":{"observed_at":"2026-08-05T15:18:34.027368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T15:18:34.097678Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.097678Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:f1a921e09b612616c851d69d3e8602caf20d5b41290b370e6b450058f5c0e77d","observation_id":"bbfcb825-8c4e-4243-9022-cddcb6cf1bfb","resolution":{"observed_at":"2026-08-05T15:18:34.097678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T15:18:34.147013Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.147013Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:d84cc275d11ef60f2fdcbbd34d5dc751c749af4d83a6ecd04a8ec8752cec6f32","observation_id":"26692736-0744-4ec6-ab86-8691a51495b5","resolution":{"observed_at":"2026-08-05T15:18:34.147013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.493455Z","title":"OneLLM: One Framework to Align All Modalities with Language","venue":null,"work_id":"c3bb45e7-eccc-45af-b24e-74c66a61d196","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.201914Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:dd228e1c4c0e31a9f945e4696d65d1d4209589142003b62f369d1cd24db987f9","observation_id":"975ac317-3c2a-4179-bac7-21f7b5ddf0c3","resolution":{"observed_at":"2026-08-05T15:18:45.558840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.308733Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":null,"work_id":"2ae2c0f7-a22c-48d1-8741-81350b38ac08","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.264082Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:b3abd2a5cf2154e4630339306f362e9dbe380a2f1ffa8fe90bde5dab0854d25a","observation_id":"48bc36a0-c4c1-4021-a769-7251e75154b0","resolution":{"observed_at":"2026-08-05T15:18:45.415876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T15:18:34.315829Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.315829Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8d225351a32b71a7e35170d2517a23f7ea2c09c3b6aa2718f08ad416325822ef","observation_id":"71a0e014-6121-40c8-bc06-53f4ad4b5d69","resolution":{"observed_at":"2026-08-05T15:18:34.315829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.102602Z","title":"A Survey on Hal- lucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","venue":null,"work_id":"f26851fc-c186-4bb1-a6bf-8d8e799851e1","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.371606Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:2b832c7164f2e3b9f9e8239841588c217e20f3db3358c99d4a4d02f884a903de","observation_id":"7a7bfd4f-cb9f-4325-bd30-aaf09ad67403","resolution":{"observed_at":"2026-08-05T15:18:45.197572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.941165Z","title":"OPERA: Alleviating Hallucination in Multi- Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation","venue":null,"work_id":"b0169a0c-c36b-4fa9-8105-fa456e586b4f","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.415801Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9cbe208a547890dabff81da7a8b24d640fc9844040a7ea9d4070e9fc61dc040e","observation_id":"c14090ae-40f0-470b-ab88-20f9de405246","resolution":{"observed_at":"2026-08-05T15:18:45.013860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11909","last_updated":"2024-11-22T03:34:15Z","snapshot_observed_at":"2026-08-06T09:35:42.681973Z","submitted_at":"2024-11-17T08:29:14Z","title":"SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11909","snapshot_observed_at":"2026-08-05T15:18:34.487538Z","title":"SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.487538Z"},"links":{"cited_paper":"/paper/2411.11909","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c88c76e4649bf8d3fa3592ee100b98487dfa72fbda6dd1183b9220dd761cb6ae","observation_id":"5e7976ae-1078-4768-951f-4cc87b0400a0","resolution":{"observed_at":"2026-08-05T15:18:34.487538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15334","last_updated":"2025-06-06T02:50:17Z","snapshot_observed_at":"2026-07-06T19:36:36.994783Z","submitted_at":"2024-10-20T08:56:52Z","title":"Modality-Fair Preference Optimization for Trustworthy MLLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15334","snapshot_observed_at":"2026-08-05T15:18:34.573801Z","title":"Modality- Fair Preference Optimization for Trustworthy MLLM Alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.573801Z"},"links":{"cited_paper":"/paper/2410.15334","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:d266ef627389d5c8b2652f72a15b97cfe7758e4b494ddb9519b27068fb8590c4","observation_id":"e846edc9-7c40-4f77-b1ce-f3caa3706ea2","resolution":{"observed_at":"2026-08-05T15:18:34.573801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.764966Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","venue":null,"work_id":"7629a207-0af8-4e57-91a3-99ff32922638","year":2015},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.627243Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a8f7e2d6e04295cc557e85b8aa53f925239a214b500615ed790962424dc70be1","observation_id":"a42f421e-1b5d-415d-9ed2-ff3e785bc210","resolution":{"observed_at":"2026-08-05T15:18:44.831257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.614415Z","title":"A Diagram is Worth a Dozen Images","venue":null,"work_id":"97e7fcd7-1481-4786-a52c-93ece6fbadb0","year":2016},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.679487Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:76d0e9cfc18025db0b539356b91a11f731f5ddb3a181b0e909bb0169d87ce797","observation_id":"59680675-abe2-464c-94f4-a16dfb6e9bb0","resolution":{"observed_at":"2026-08-05T15:18:44.684805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.443430Z","title":"Adam: A Method for Stochastic Optimization","venue":null,"work_id":"53106dbd-0a7f-4a3c-ba4f-f6ed7e281bd0","year":2014},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.760053Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:25b0986d50f82d6551d235a085fb28f0e63960215147a9d13a9a94a08dbc05b4","observation_id":"5e912978-ee41-49a9-9984-22d5bd633da6","resolution":{"observed_at":"2026-08-05T15:18:44.544165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.281180Z","title":"Building and Better Understanding Vision-Language Models: Insights and Future Directions","venue":null,"work_id":"e1cb0a43-1600-4e8f-b290-cb3e643f2859","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.809548Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:02ec0af0a99dc4b14bd1bc360dea2955eb09c938eac342c07b1f804673869c88","observation_id":"1052199a-a17c-4420-88d2-7892d7a4e89e","resolution":{"observed_at":"2026-08-05T15:18:44.355978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.137162Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","venue":null,"work_id":"3d58f6db-76bc-43cd-9e80-e1297d94584b","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.877521Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a7d677aac3680d852e62d11fa6367e960759b4ddeb19d972d42918627e05e096","observation_id":"782f36dd-a6c6-4514-9b0e-130490a86fe2","resolution":{"observed_at":"2026-08-05T15:18:44.204406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T15:18:34.966231Z","title":"SEED- Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.966231Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:023203d9dae744d69dea544cc1385102125c09b267f32ef8ad84155a180d1d3a","observation_id":"40f8d7e9-5703-4601-bb7d-a57e3398ae68","resolution":{"observed_at":"2026-08-05T15:18:34.966231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.991065Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"e59dcd16-abfc-4d92-b4ed-812bf2814e2d","year":2014},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.986672Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:aeb4c346a339b5b8a13d440464259829cfcbdd0f1fbf61eca6872b1e7c0f64e7","observation_id":"58dee9f8-daed-449c-9788-e2ce6244e4a2","resolution":{"observed_at":"2026-08-05T15:18:44.061394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.861531Z","title":"Visual Instruction Tuning","venue":null,"work_id":"09789d99-abc9-43ff-9d1a-e96850f8cf96","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.104916Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a17a1c01262b0d2ad4f730e0adb3d92b44452989b8173bacd67c426ae1434820","observation_id":"8a29cf57-fccb-4d96-804a-05a41d34fda5","resolution":{"observed_at":"2026-08-05T15:18:43.906662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.690925Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"b135fa63-15c7-41c5-b726-ad98985f3317","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.168310Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:ed58be0dcf109762ced6385a702d1c016925803d4538602c0675d4efdfc3ed2c","observation_id":"c781c242-1977-4ea8-9c01-e67a1ebf7b27","resolution":{"observed_at":"2026-08-05T15:18:43.781369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.482680Z","title":"Neural Baby Talk","venue":null,"work_id":"dd3cf16a-5cab-4e2c-b701-ae115b6f256d","year":2018},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.235925Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:4df08c8630ec17f5999c9ee3d0cad183daaa44e3fb892fa1c9c7c8d82598c6d8","observation_id":"8f50a13a-764c-48c3-80ec-3fa938bc28b8","resolution":{"observed_at":"2026-08-05T15:18:43.575627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.367597Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","venue":null,"work_id":"e81e1e25-9b62-4284-964b-e46e7caed832","year":2022},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.338300Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:117cac33277fd49515fbfc58ebd0964b936de27abcfb901ebb8b14ef86a12ce5","observation_id":"77d1b174-dcb7-4de3-9546-555040288061","resolution":{"observed_at":"2026-08-05T15:18:43.406314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.231818Z","title":"Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization","venue":null,"work_id":"1e63bdff-a215-4924-903c-721d0a882695","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.418133Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:2588a785f125a889918bc1db3dd49464808fe199847ba6ee4c1f673bec6423b6","observation_id":"8dc5e733-1208-4222-ab15-4a45185e77ea","resolution":{"observed_at":"2026-08-05T15:18:43.299250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.018502Z","title":"Training Language Models to Follow Instructions with Human Feedback","venue":null,"work_id":"fc881477-da54-4724-9e63-7396f58adbef","year":2022},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.522414Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9b81108d9c72e5bbe662559e93021dce384856ddbaff11ac35902c7496b07218","observation_id":"832d9554-25a1-458b-aafb-d7903e8b18df","resolution":{"observed_at":"2026-08-05T15:18:43.120956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-07T23:02:57.475253Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-05T15:18:35.610779Z","title":"X-InstructBLIP: A Aramework for Aligning X-Modal Instruction-Aware Representations to LLMs and Emergent Cross-Modal Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.610779Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:60e105f86f2bc04700d5c9197ca84e4b17908faae949cdd11a594c733c770317","observation_id":"bee4125a-b824-4a19-a701-e96c733a7aa2","resolution":{"observed_at":"2026-08-05T15:18:35.610779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T15:18:35.706620Z","title":"KOSMOS-2: Grounding Multimodal Large Language Models to the World","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.706620Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:34f8816b571784b15c4b02d9018f65c25073c5e88894cbd2e401a03bdcf2062c","observation_id":"9544c7ab-c9dc-49a6-a6ee-5bbee819651c","resolution":{"observed_at":"2026-08-05T15:18:35.706620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.835496Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","venue":null,"work_id":"8fd3e311-23d9-4a31-83c3-543a3420d414","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.805621Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c7e9579ed6f755f83db28d45a649df3c43f07488570b64417ede891bc136a29b","observation_id":"20eb7156-1f02-471e-9caf-07b94a86a2ec","resolution":{"observed_at":"2026-08-05T15:18:42.905433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.648458Z","title":"Learning Transferable Visual Models from Natural Language Supervision","venue":null,"work_id":"db6361b9-56d1-4da2-b2b7-8a643e5ddd53","year":2021},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.930386Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:5c8a7ccf39f92955237add4ec52450763442cbbcc271cd97ca1939676a4c650e","observation_id":"07fdf4d2-ab81-4fa0-b523-3151a51980cf","resolution":{"observed_at":"2026-08-05T15:18:42.755521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.466841Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":null,"work_id":"8946df7a-3ee2-4cde-b1fd-310c912ac0c6","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.047228Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:2d54838e0be9e64a95adce76e0f73bb7a569c5fe037de596edbb27f84317f6fb","observation_id":"843fec70-3497-42ef-b395-0745e3657dc9","resolution":{"observed_at":"2026-08-05T15:18:42.550010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.272496Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"90e7c76d-3b72-4021-8331-be32b52fbc45","year":2020},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.126068Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8f8ca1ae7efed9af3ac19c20af7595a83d5b6268b4d2cafca6c94e188e4d1c76","observation_id":"2ab81ef8-0b8d-4628-a278-a6ef25256dbf","resolution":{"observed_at":"2026-08-05T15:18:42.384739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.071909Z","title":null,"venue":null,"work_id":"2cb66c43-82e9-41a9-a767-8a45f4b57cf7","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.231373Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:4e2dba44d28ea3ca29691f54be0ced7fdde3adf6d9c8b3cefa9e8ddc7976c488","observation_id":"95965ad1-59e2-46e3-8621-f1a702492dc4","resolution":{"observed_at":"2026-08-05T15:18:42.192143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.905492Z","title":"GLaMM: Pixel Grounding Large Multimodal Model","venue":null,"work_id":"f91b3a37-9ecc-4c4b-a5a7-e4c135f0b5fb","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.346112Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:44d224a486b39da40442bc74dc478ed10984227b50dbb6cd5ddc59e272f91eae","observation_id":"aeffee8b-6a26-47bc-a105-d830f14030d7","resolution":{"observed_at":"2026-08-05T15:18:41.986421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.663891Z","title":"Object Hallucination in Image Captioning","venue":null,"work_id":"b63d0d55-511f-40aa-acdd-bc2b550312e4","year":2018},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.415263Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0e984fe103a13c6da9c33862590d80d32acf52961dd69712e42fdf6e35ab62c0","observation_id":"f21c23fc-3b63-43d6-b3f3-1ab37cb59282","resolution":{"observed_at":"2026-08-05T15:18:41.766647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.433076Z","title":"A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models","venue":null,"work_id":"a6935a54-a1f5-4e08-ae31-3733f134fa85","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.509687Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:06d0a5f69bb85ad801ebb9db76cdeae1d83f657a9b82c0dc45e24dfe7c8a7859","observation_id":"e2148b3b-839c-4bc9-b88e-1885fa84595a","resolution":{"observed_at":"2026-08-05T15:18:41.518595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.206538Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","venue":null,"work_id":"9fd64267-f765-4feb-bdf3-25e551ab488c","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.579679Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:55247a87e26fa9a1568ed82a8367347cb4b0bdaadfa213db58fea88811fe2806","observation_id":"18cd79d6-89c2-4614-9fd1-0edbf04ae8c5","resolution":{"observed_at":"2026-08-05T15:18:41.320547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.019073Z","title":"Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives","venue":null,"work_id":"7a4d002e-4a3a-4ee4-b849-75b79deba72b","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.705610Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:cb25043673d500a63168fa12bf7a965b499053e38f213b64fb9dac1a1f4eb142","observation_id":"2039ac83-8e54-4728-b8a7-577a9767572f","resolution":{"observed_at":"2026-08-05T15:18:41.081923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.762121Z","title":"Preference Ranking Optimization for Human Alignment","venue":null,"work_id":"c7189794-ae84-47c4-be0b-24a10cca4c56","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.810488Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8ff2ab395bd6adfac59a27b86f7292336b018ccc6319cac175598d1bc49b731a","observation_id":"cbd03fb7-f0da-4845-9c97-0303d3c985e1","resolution":{"observed_at":"2026-08-05T15:18:40.899088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.546164Z","title":"Generative Multimodal Models Are In-Context Learners","venue":null,"work_id":"6e60bbe9-7d09-4e5b-b433-6febd3290d0d","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.909666Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:376a85f648bfb8be861943f06d0b71f9dde170217eeb25a852de660725b202d4","observation_id":"1421c234-b11e-4b39-b548-1af87161d091","resolution":{"observed_at":"2026-08-05T15:18:40.659037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.255312Z","title":"Emu: Generative Pretraining in Multimodality","venue":null,"work_id":"a9d6da9a-46d8-4cd7-afa6-d16a337b7357","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.985220Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:ac551ce496b98ef34bd934ce74682927a17404026201861fa8e0fabef205cb39","observation_id":"8bfa37b4-121b-4936-9a27-13d83b38e546","resolution":{"observed_at":"2026-08-05T15:18:40.408757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T15:18:37.090202Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.090202Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:4ace08a0852d423bca212cbffe356654d168176feec9408e110077d03e32ea32","observation_id":"a9ea855e-2585-4e7c-b925-5d19ae5679d1","resolution":{"observed_at":"2026-08-05T15:18:37.090202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.053535Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","venue":null,"work_id":"fd0e3d51-cdcf-4add-b5f2-b7b03fe41fc8","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.175875Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:f5500ecbaf395abc2b75b656579c2a7ed0fe6252ce0bbbaee3dfcb335a1b10d4","observation_id":"b496aa58-812d-4983-9b89-7980a5cfb16d","resolution":{"observed_at":"2026-08-05T15:18:40.143255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.868294Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","venue":null,"work_id":"5de222dc-9638-4227-9141-a0ee8432f6b6","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.237229Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:58cc1633ba8ec53b3b5a6c06aff9c45b0adbec4155ef60a592cf7179f6406b77","observation_id":"542df41f-67b2-4837-b2cd-d153c98b5043","resolution":{"observed_at":"2026-08-05T15:18:39.954334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-05T15:18:37.343758Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.343758Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0c09d9d5fe25188214b9a3467268c51efce1008a77446a2ae9bec6a0bc4cbcbb","observation_id":"e47e4548-3d66-4c7c-812c-0ee946ed0445","resolution":{"observed_at":"2026-08-05T15:18:37.343758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.676215Z","title":"β-DPO: Direct Preference Optimization with Dynamic β","venue":null,"work_id":"35715d94-4be9-433d-94b1-e5df46bc7d7c","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.450314Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:44def07d10d5b7768b0e8c952bda6d746d570ebf396338aa38c671e56a6e24e2","observation_id":"763ebf0d-5362-40ed-bb2b-a54dc70e86a7","resolution":{"observed_at":"2026-08-05T15:18:39.747243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:37.545387Z","title":"Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.545387Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:3db576994e68f7f8ac1219d5b65534a3b7beaf50edde4b09d1a19264924cb4a4","observation_id":"71201094-c262-4c15-a072-894163de4499","resolution":{"observed_at":"2026-08-05T15:18:37.545387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-05T15:18:37.645387Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.645387Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:b46f64a1d11f00957b7e4d3948feb9d7ac5f7f4095c74636b8d06231a6d8d739","observation_id":"68748eee-39d8-4884-970b-7d04b4f7f28e","resolution":{"observed_at":"2026-08-05T15:18:37.645387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.462445Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":null,"work_id":"04afc5de-67df-446e-b0d0-d1ccd6992694","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.730768Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0f1a88ce3e57b92d59092abfaadf6ba8e5fad24525f5c384df7a2f35695d396d","observation_id":"da24e78b-5ea9-48d6-b792-84db0f1e00c9","resolution":{"observed_at":"2026-08-05T15:18:39.562614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.224553Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","venue":null,"work_id":"a1bc17e4-e1b5-4d79-b70c-15bb46bb2dc0","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.868533Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:3a536fae8835aa9fbdb7b966d103e94ba51803b3540774629e520c8dd44e4317","observation_id":"54aecb68-9571-4f58-aad0-03e267d4e7cb","resolution":{"observed_at":"2026-08-05T15:18:39.284926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.065832Z","title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","venue":null,"work_id":"4b255f06-49b3-495a-84b0-6deb36f9857a","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.961289Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0a309a72eb6db70ba4783d199cf5bc5bc2862df85e10df44a895e04a8d55c3cb","observation_id":"59fcc504-01a8-47f3-ac35-cb77c76f39af","resolution":{"observed_at":"2026-08-05T15:18:39.157806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:38.869239Z","title":"MMMU: A Massive Multi- discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":null,"work_id":"7fca4201-7a79-4445-b5f0-4af5ba05345f","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.030782Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:57c114f1641228b3d079aaa5d03b56b3bfc96c7a2b7c9b3733b32d59d5276017","observation_id":"313a7679-acee-4046-a3cd-d430e7fe5070","resolution":{"observed_at":"2026-08-05T15:18:38.972271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:38.677998Z","title":"Less is More: Mitigating Multimodal Hallucina- tion from an EOS Decision Perspective","venue":null,"work_id":"269f20dd-5506-4846-82e9-f54ef4500686","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.089116Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:2551c234aea8b93e2614c70c22904442404729bd23242de50334860fc28d6c2b","observation_id":"546fe4ea-ce4f-4fe7-b9f4-1bd76adecadc","resolution":{"observed_at":"2026-08-05T15:18:38.798240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-05T15:18:38.154826Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.154826Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:accf017b7ef02adc75c01110cac4d6c5793b730a65672a3b3aa63e06c3b1481a","observation_id":"1661428f-ebf7-4c65-8919-adb87ceb1eb5","resolution":{"observed_at":"2026-08-05T15:18:38.154826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-05T15:18:38.238296Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.238296Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9bcbcc492ee077353f6097b97fa489ac6d96626a291dbed7355d3db6649ded18","observation_id":"cd5e3884-6b94-458c-8444-5aad718bfc37","resolution":{"observed_at":"2026-08-05T15:18:38.238296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-05T15:18:38.304903Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.304903Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a2dfa2d29ef4fbfa2812f0e2a12f292b440be81cf1125a75506b00efb3c96ba8","observation_id":"434d2507-e21f-4685-9e3a-59f1de608687","resolution":{"observed_at":"2026-08-05T15:18:38.304903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.887931Z","title":null,"venue":null,"work_id":"84406e39-d47e-4193-a845-d2d79d2e65b4","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.768882Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:b7fa8b756163520b4313da1d4e604488663540e8f1389a45147ab4955d8ed18e","observation_id":"58115e0f-2772-4f35-9bbf-efa8d4f24aa3","resolution":{"observed_at":"2026-08-05T15:18:45.992589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T22:00:21.216650Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2508.20181."}