{"as_of":"2026-08-13T09:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d167863bf374b98c2fc0514a86a7e3d7d9f6e94a8b9869eb3a78ca318f8fed5c","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:19:45.907689Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:18:39.999709Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T17:18:42.348103Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"cited_work":{"arxiv_id":"2411.13697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.13697","snapshot_observed_at":"2026-08-10T17:18:42.348103Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","venue":"cs.CV","work_id":"aa06bd68-8ccf-4d1c-ad7b-054b96ed2b78","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-12T10:02:12.958369Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.999709Z"},"links":{"cited_paper":"/paper/2411.13697","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:de8cc7cd6203a5e604d0a15bc58b2607a587e99262527fff8809db067a6b0439","observation_id":"a76663c8-4a8f-4508-9668-446e09af7a64","resolution":{"observed_at":"2026-08-10T17:18:42.352989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13697/citation-record","integrity":"/paper/2411.13697/integrity","json":"/paper/2411.13697/citation-record.json","paper":"/paper/2411.13697"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.347131Z","title":"Llama 3.1 8b instruct","venue":null,"work_id":"77b9ffbc-1edf-4e22-9f3e-18940747c72e","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.617545Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:ecd07c15c21a4ac411d3f000c1bb5f2b44b229e3ed34d5d3032e04228c8821b9","observation_id":"e856053a-6e0c-4a4f-b7fe-56e089518534","resolution":{"observed_at":"2026-08-12T16:19:57.352098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.331655Z","title":"Neural module networks","venue":null,"work_id":"b21d6769-44c5-4cc9-88af-bd0f387c2f69","year":2016},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.623178Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:8669919f9fd00da5145380c2b8b5c07d6e65d37fb7e3edd7a065c547dfa29d8c","observation_id":"60ae80d8-2c42-495e-b593-0390a4b8b6a8","resolution":{"observed_at":"2026-08-12T16:19:57.336364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T16:19:45.628581Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.628581Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:d32fb33bc024309f53326900c48d22b3f798e0dba6bd3e4e62779c0b2820a8bf","observation_id":"f12f664c-4f19-4989-8a7d-daa471ee13ab","resolution":{"observed_at":"2026-08-12T16:19:45.628581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.315355Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"09c071c2-9290-4b6f-a3d9-987fb627599f","year":1952},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.634687Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:9bfce21829ef6331cac9aa103b48710401579dc951c9bbbd808f5c64e78c3d30","observation_id":"f3f049da-c169-4a70-939d-8025379a2636","resolution":{"observed_at":"2026-08-12T16:19:57.321195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.295982Z","title":"Modularized zero-shot VQA with pre-trained models","venue":null,"work_id":"e017e93c-0afd-4447-8627-ce0301c128af","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.639961Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:73244f9b727c44b117fa148a79c53741a8a241ce79240516e063a072d3d305ec","observation_id":"81ac125f-6d5e-4013-9888-b504a77fef0b","resolution":{"observed_at":"2026-08-12T16:19:57.301616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.279799Z","title":"Complex claim verification with evidence re- trieved in the wild","venue":null,"work_id":"e118fa7f-8c7e-49a1-94a3-f12e8cfe1938","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.645297Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:cdab13d4ef6c2e674e634825be01706c2b6493bf374966f2d9afb5ef090d164d","observation_id":"2d805f23-9fcc-43d2-a855-7147837deef0","resolution":{"observed_at":"2026-08-12T16:19:57.285170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T16:19:45.653175Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.653175Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:c5295b1d65e41391bbe4bdc6a9ba3a20ed9c507c7aa1fd48c8b2ad134b765bb0","observation_id":"210b3e1b-eab2-45ac-84b4-a6dccdecdd07","resolution":{"observed_at":"2026-08-12T16:19:45.653175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.263239Z","title":"Making the V in VQA matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":"a2dc68bc-1cd5-4422-9bab-4594465be4c5","year":2017},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.658498Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:ab470a62afc2864a41cf36216e87cf3346d225f400b1b49af43a81e41ea2a368","observation_id":"89ea2ab6-5635-46fe-b44e-ec01a53e9f69","resolution":{"observed_at":"2026-08-12T16:19:57.268963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.244961Z","title":"Breaking common sense: Whoops! A vision-and- language benchmark of synthetic and compositional images","venue":null,"work_id":"de2fcd8e-fe36-47b0-bd33-374b053605e1","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.663625Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:08781473ee880b45cba62f2790531108d1958c90480954e92c413eeec3998257","observation_id":"32f2aad0-d4e5-4acc-960e-edf2128df124","resolution":{"observed_at":"2026-08-12T16:19:57.250746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-13T04:16:46.302787Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T16:19:45.669568Z","title":"Efficient mul- timodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.669568Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:899b54af489c1f7ab07fbfa71f0c28eec1efd1aab443b16e781711d12a747f75","observation_id":"711b46af-a74a-47e0-a91f-b5a38aca166c","resolution":{"observed_at":"2026-08-12T16:19:45.669568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.226201Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"a4dae413-0267-4e92-b2ef-db5ecb25a7c9","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.675412Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:c0346c041888cc8880c88aa8ffb6c996ae1736fa865284173e460ffc86e47835","observation_id":"20631d07-13c1-4d08-8294-9f391786b97e","resolution":{"observed_at":"2026-08-12T16:19:57.233252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.207047Z","title":"Learning to reason: End-to-end module networks for visual question answering","venue":null,"work_id":"027a51b0-58c1-475f-a97d-e220e5a229b0","year":2017},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.681503Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:ca56fe39cc5ecab1d7aa3caa9e83582554908fb10ad57b60d2e54dfd5a3c40f2","observation_id":"b4c42340-4a5c-45d5-9213-fa1d075372fe","resolution":{"observed_at":"2026-08-12T16:19:57.212297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.188877Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"e5a715b7-0c87-4aa9-ae63-ca2ee02be234","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.687036Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:6d77ad89776e5826a1781cc5b7a36dafcaba40cf021ce9b77cbc2e47107ed7ab","observation_id":"7a7eaa0a-5988-427c-ad5c-bc22122c910d","resolution":{"observed_at":"2026-08-12T16:19:57.194409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.170236Z","title":"Hudson and Christopher D","venue":null,"work_id":"d4fcf501-6b12-420a-a2e9-40cf0fbc5dbb","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.692794Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:796a4b9ccfe022d6d44bc92f7e6676c07b1a491a4cfb95f9eff494bbf6c28e9e","observation_id":"a7617016-d6cd-4281-88a9-0c132aa9a876","resolution":{"observed_at":"2026-08-12T16:19:57.176796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.150770Z","title":"Hallucination augmented contrastive learning for multimodal large language model","venue":null,"work_id":"7abfc5b3-11e4-4682-9fbe-16baf740b2d3","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.698531Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:d0108c7b0e6666463189998472702bfac10c62e49a010e14e79f8827c96b975a","observation_id":"47bf757d-5a76-4b4e-82d0-9cd359ffe7e8","resolution":{"observed_at":"2026-08-12T16:19:57.156178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15721","last_updated":"2024-11-08T05:08:43Z","snapshot_observed_at":"2026-08-13T04:11:02.645672Z","submitted_at":"2024-02-24T05:14:52Z","title":"Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15721","snapshot_observed_at":"2026-08-12T16:19:45.703566Z","title":"Hal-eval: A uni- versal and fine-grained hallucination evaluation framework for large vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.703566Z"},"links":{"cited_paper":"/paper/2402.15721","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:9637199076a3d2f186fc7f376d5bcdd9ddef717da8bc72f9bfe3c963eff741aa","observation_id":"503ae8ae-5719-42b0-b0d1-1def6e291805","resolution":{"observed_at":"2026-08-12T16:19:45.703566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.133013Z","title":"What’s ”up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":"f2f44dfe-a1ef-4a18-94c1-329ae4419cbd","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.709416Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:467f17dff95466d46edd98567d53f407c98cf529bf7aa1f2d36c1d2d84b61385","observation_id":"7ee622db-7b9b-48ba-84f1-693bd84cb659","resolution":{"observed_at":"2026-08-12T16:19:57.139146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.112266Z","title":"Shamma, Michael S","venue":null,"work_id":"6a02aeeb-3978-47fb-9cc9-81f46f07c0f7","year":2017},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.715042Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:06772a6ed44e9a299b9943ba843484c6eb99917bbed864a2ace79aa1f662ed98","observation_id":"79ed3313-35b0-4be9-bf92-0a156e22896f","resolution":{"observed_at":"2026-08-12T16:19:57.119188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.088003Z","title":"Mitigating object hallucinations in large vision-language models through vi- sual contrastive decoding","venue":null,"work_id":"ccf0f615-fd7c-46ca-bb95-a57bff2992ed","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.720246Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:befb57b2a3889c9849619077d54d9e3be3e805efd4bce0b3ce94e7c21668cbf9","observation_id":"e5e98b55-daa9-4db5-bf27-cff4e094e6d0","resolution":{"observed_at":"2026-08-12T16:19:57.093735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.069353Z","title":null,"venue":null,"work_id":"7a08e2a3-0aa9-46bd-b8c4-6e579308d5e8","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.726063Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:0b7e4212824ac153577deae7a57c376fe6a4af20e421a27f49bf4a23ddd81b01","observation_id":"f3485cbb-1db5-4fd5-b709-581e204e9658","resolution":{"observed_at":"2026-08-12T16:19:57.075879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-13T05:00:07.845665Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T16:19:45.731027Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.731027Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:6345561f725a11a340064c48c7e12e2f7bda8aea57b946384b393223ee4dae3c","observation_id":"4a215b56-61d5-4b59-9c3e-91dad1ac794f","resolution":{"observed_at":"2026-08-12T16:19:45.731027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.050891Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"707433e0-af2d-4e84-864e-1478b4f815a7","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.736090Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:3d3c5ce37141afd2ec661f891865a8e450026a2474b21279e681bf482711eac2","observation_id":"bf3af5f6-456b-489d-b3fc-5371f602f1c8","resolution":{"observed_at":"2026-08-12T16:19:57.056305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.032688Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"7de3e1a4-bcf4-4e5d-9273-fe833d70c2be","year":2014},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.741796Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:f76d8633874248e53ceec6bd096518c5f81ea418a629ab49695a4450d92bac1b","observation_id":"0d488472-9d28-400b-b160-f52ff37fed44","resolution":{"observed_at":"2026-08-12T16:19:57.038420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T16:19:45.746266Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.746266Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e6a6bd99905846ea8477f950cd75318d588e0f6a842d4720bce2966c9e687d9d","observation_id":"33dc35c4-8198-4966-b538-5526e5d36670","resolution":{"observed_at":"2026-08-12T16:19:45.746266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.012828Z","title":"Visual instruction tuning","venue":null,"work_id":"fe83077c-f339-49d1-8d29-74ce7bccbd90","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.752362Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:b94b97c2040a06662c7c0908db72992bac630f2b89063f11eba6e814e07344b3","observation_id":"f1fa9123-ad8a-41a9-8c06-7fdaf60de9b2","resolution":{"observed_at":"2026-08-12T16:19:57.020016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.990909Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"12a02924-0415-4803-971d-7f7c66b44ad1","year":2019},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.757094Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:04048e2da788ebbd8dcc14fa4c88ef1851127c1ce095f9abe984d67820ea36d2","observation_id":"b8ea8780-131f-40e6-af45-df2c5a4489c5","resolution":{"observed_at":"2026-08-12T16:19:56.997419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.972654Z","title":"Factscore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"ad8bc8c4-6a0c-4d7a-bcb8-d545a86d1639","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.762073Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:3f629c8ad29ff3a22b1565d255882c84582381b6dae552d437d5e4091a037ef5","observation_id":"74492595-f18e-4550-82aa-ecd00f0933b6","resolution":{"observed_at":"2026-08-12T16:19:56.977946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06230","last_updated":"2022-07-20T12:24:25Z","snapshot_observed_at":"2026-07-06T13:09:25.356940Z","submitted_at":"2022-05-12T17:20:36Z","title":"Simple Open-Vocabulary Object Detection with Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06230","snapshot_observed_at":"2026-08-12T16:19:45.767294Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.767294Z"},"links":{"cited_paper":"/paper/2205.06230","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:ca0c46fddbade7844eee751e2cb71b8e4bfaee4fdc544448876b7cba8c041019","observation_id":"f3140a77-321f-4304-b80d-f00ae3241971","resolution":{"observed_at":"2026-08-12T16:19:45.767294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.955575Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"9474f73b-aad4-45f5-beaa-21b23d7548b6","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.772200Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:bdadbc8fbfae1466c38d5818fb2c07188a9ffac5f80a8e58d64db3802b589e0e","observation_id":"7db73d87-d104-4f06-b485-27237718928a","resolution":{"observed_at":"2026-08-12T16:19:56.961296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.939439Z","title":"Morris, Eli Lifland, Jin Yong Yoo, Jake Grigsby, Di Jin, and Yanjun Qi","venue":null,"work_id":"69ccd1ad-b886-4c0b-bbd4-d84be428e700","year":2020},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.776930Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:93743ffbbea49207bfcdcbef843a91eb923e20f920c88c5ae450adc2b4b26555","observation_id":"51092136-b004-4cc0-8694-69fe49af5349","resolution":{"observed_at":"2026-08-12T16:19:56.944636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:19:45.782370Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.782370Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:c52124ab40965521908e629b31783521576d8ccd4232b9b3016260077eb14886","observation_id":"d5def5ee-c41a-4c82-a70e-64e9ec9750bd","resolution":{"observed_at":"2026-08-12T16:19:45.782370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.919148Z","title":null,"venue":null,"work_id":"f40de2c9-8684-48c8-ae81-e845e4cca7e2","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.788154Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:ab95728bdcef643c3fafa29e87435c5b43ac82171c6e2550f2011efcc703a916","observation_id":"d4acb592-47a9-4d75-8a8d-eec4f4b653f5","resolution":{"observed_at":"2026-08-12T16:19:56.925402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.897011Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"42acb6b2-1ad2-4a3c-93c8-578765809b53","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.792880Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:8965f4ae21afaf0b3bd595d6adafa89e39a9b58d9920ff29420b88f46a3e4c1c","observation_id":"8dd92a20-2a24-4a0f-8491-9d5b5597c2e2","resolution":{"observed_at":"2026-08-12T16:19:56.904101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:45.797663Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.797663Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:60448dd82514dede51c6ac63b90a543a4672a9ff6317007f0eba0a02cc6e674b","observation_id":"195df677-367f-4b23-9313-fe107c63c567","resolution":{"observed_at":"2026-08-12T16:19:45.797663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18654","last_updated":"2025-02-28T00:26:42Z","snapshot_observed_at":"2026-08-12T23:55:39.623414Z","submitted_at":"2024-05-28T23:36:00Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18654","snapshot_observed_at":"2026-08-12T16:19:45.802265Z","title":"Arik, and Tomas Pfister","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.802265Z"},"links":{"cited_paper":"/paper/2405.18654","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:b7f98eb744792c97ed19fce28fd6666d380e1fe5e7d351d9778d5a832f62127f","observation_id":"8d86171e-de17-4411-888f-2c2101986102","resolution":{"observed_at":"2026-08-12T16:19:45.802265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.863476Z","title":"Toolformer: Lan- guage models can teach themselves to use tools","venue":null,"work_id":"08faaa4d-549a-4130-8075-2726c844ae10","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.807698Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:cbb0d66f75314c9cb7385425754c7ebb0105446b35c02a4f2a66416b21520600","observation_id":"d05d7781-24a7-4386-a523-9fc6ad15e9a6","resolution":{"observed_at":"2026-08-12T16:19:56.869860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.845504Z","title":"Averitec: A dataset for real-world claim verification with ev- idence from the web","venue":null,"work_id":"ab5177cc-6937-473a-aaba-b6760f954b75","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.813661Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:fc67f44f1548c1fe32db12ae6097d1534d57c6dff8af998f52e2bdd9dc1820ce","observation_id":"14eae642-95d4-4eb1-89f7-a02f446fd42f","resolution":{"observed_at":"2026-08-12T16:19:56.851223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.826114Z","title":"Towards VQA models that can read","venue":null,"work_id":"e209c8a7-79e3-4b8d-bf7c-3c88a803b737","year":2019},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.818960Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:a975138ace23a89797165c88f259b3902ed4db38aeaae7e625ac17a37f03f4a3","observation_id":"89250df4-7829-4ab8-b33b-fb3b36af9054","resolution":{"observed_at":"2026-08-12T16:19:56.832658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.801999Z","title":"Reclip: A strong zero-shot baseline for referring expression compre- hension","venue":null,"work_id":"cbc6066e-37ee-4aea-9605-6d6546ebd515","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.824360Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:404bd0d76f55cb50930e77728fc2b778b543948728fc73963c4cdf48e191be5c","observation_id":"5a041ad3-fc9a-4441-aa80-15e68acb0fb2","resolution":{"observed_at":"2026-08-12T16:19:56.808390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.778563Z","title":"Aligning large multimodal models with factually aug- mented RLHF","venue":null,"work_id":"32064c81-1682-4a10-af6e-513ee503b378","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.829246Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:13e37ac8c6e29d9599fb9b8b613061fae45b30573c5fa8a684b25fe213e8f9fe","observation_id":"4272d5f7-1285-4f9d-97fc-d494b65de514","resolution":{"observed_at":"2026-08-12T16:19:56.786805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.758488Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"bdd3b297-72d7-43c5-afdb-057c862c6951","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.834397Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:b8c8d69de699a6dce8164cc22f16080cc813b5bfcf42195b69a36faf867afd53","observation_id":"24009d21-2838-45f5-b1c7-f608ec8eb06c","resolution":{"observed_at":"2026-08-12T16:19:56.763724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-12T16:19:45.840224Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.840224Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:afb60af427bbd5a5aacfa6fef80a157240196c3c4e72d0b5c3e2edac4dec9e66","observation_id":"8c198218-3604-4888-9501-cfca0cedf142","resolution":{"observed_at":"2026-08-12T16:19:45.840224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-12T16:19:45.846143Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.846143Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:d5b65f0b012d6ea3682a81a1e493b03275e6fe09577584ac1349b2420825938f","observation_id":"c49e7674-0f24-430b-a717-72fb8183d2c2","resolution":{"observed_at":"2026-08-12T16:19:45.846143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14233","last_updated":"2025-01-06T13:58:45Z","snapshot_observed_at":"2026-08-13T00:24:37.075054Z","submitted_at":"2024-04-22T14:46:10Z","title":"Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14233","snapshot_observed_at":"2026-08-12T16:19:45.852589Z","title":"Detecting and mitigating hallucination in large vi- sion language models via fine-grained AI feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.852589Z"},"links":{"cited_paper":"/paper/2404.14233","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:af27d0533a7ed4a4ae072b5616717581350478e1f8580707f3ce26af3a829edf","observation_id":"abb57ec7-d839-4ee2-aff5-5ac93aeef63a","resolution":{"observed_at":"2026-08-12T16:19:45.852589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T16:19:45.857856Z","title":"mplug-owl: Modularization empowers large language models with mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.857856Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:64952cb4da9ff0eaec5dc7606781d64db7773602ea9c9e3c02a09a46e6fa5396","observation_id":"2e0f2944-4597-4162-b86d-a19b143ecf7b","resolution":{"observed_at":"2026-08-12T16:19:45.857856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-13T05:41:56.516364Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-12T16:19:45.864159Z","title":"Woodpecker: Hallucination correction for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.864159Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:9d6ab906b1b9c48d1c8c6857e8d06066522d0dd9115ccd374f994c07252a3da3","observation_id":"23fbd567-653a-4f0f-aee5-3b77a5136fd1","resolution":{"observed_at":"2026-08-12T16:19:45.864159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.739046Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"23fd846c-8016-4735-86ca-5445912f9c41","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.869769Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:af26a3d5754fe9ce27e7334b85c7d455c0ba4bd21a782dd3fdbf57b253db9233","observation_id":"070514aa-d647-4995-9df7-f3f2f0995191","resolution":{"observed_at":"2026-08-12T16:19:56.745479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:45.875159Z","title":"RLAIF-V: aligning mllms through open-source AI feedback for super GPT-4V trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.875159Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:dc3afd1605e1c33f67f11f0bb0f83b5136967f4fad180e1ecbde513ab1572faa","observation_id":"0ea2a3c2-2946-4c1f-aa6b-dc5e1eaec77d","resolution":{"observed_at":"2026-08-12T16:19:45.875159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.718183Z","title":"Less is more: Miti- gating multimodal hallucination from an EOS decision per- spective","venue":null,"work_id":"a0dc5874-5df6-46e1-8e9a-e0e61a4b6b5f","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.880507Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:d9b4149f9f3be9115dbe308a53e152332c1b5632643edace75469fb935b96c4e","observation_id":"05dfe205-3478-4350-afee-968d54eb9446","resolution":{"observed_at":"2026-08-12T16:19:56.724835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-12T16:19:45.886327Z","title":"Vl- checklist: Evaluating pre-trained vision-language mod- els with objects, attributes and relations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.886327Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:3ae6274666c7285eed0cb1c6eb74ab511d69e54a4bc5a430e17916c05c3a3986","observation_id":"f76ee1ca-8be6-4b4d-8d62-c1543f2210fa","resolution":{"observed_at":"2026-08-12T16:19:45.886327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-12T16:19:45.891415Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.891415Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:264fae13c318a6d6ebb960fa32a2fe71c17733b6b97ce85b977daf9cacc8436f","observation_id":"8217e480-5c65-4cf6-8ed8-8967d74ffa66","resolution":{"observed_at":"2026-08-12T16:19:45.891415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.694267Z","title":"ROME: evaluating pre-trained vision-language models on reasoning beyond visual common sense","venue":null,"work_id":"9ba671dc-2543-4c5a-8aab-fd01aa11eab8","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.896930Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:6ba025a9e0d6cad65fa90b1baea6917c4baf589a28976d9727e2ca1958b5b6af","observation_id":"672a8d6a-4b5d-4751-838f-50e30593158b","resolution":{"observed_at":"2026-08-12T16:19:56.701669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-12T16:19:45.901914Z","title":"Aligning modalities in vision large language models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.901914Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:8fc312559e3d1e39c93f1127938daa54e5145814d219a29bf1612ab05f82829b","observation_id":"0544ff14-ccb0-47a9-bf0e-41073097769a","resolution":{"observed_at":"2026-08-12T16:19:45.901914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.672871Z","title":"Is the {sub} {relation} {obj}?","venue":null,"work_id":"aff01a56-4e3b-4150-bd76-47513bf67a42","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.907689Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:224f734b4f0316d092724248fb21afcfaa11fbcbfa67bc601a604a88923af888","observation_id":"252f9984-8921-40f9-b03b-4fb8f2b2d412","resolution":{"observed_at":"2026-08-12T16:19:56.680852Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:43:05.756219Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2411.13697."}