{"as_of":"2026-08-13T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36f2f0f1ff957bc89dcf02c2d29b9e5e2be7311e33c431bfc5f06d05a3be9433","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:27:33.494574Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:56:01.975427Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:36:16.802423Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18203","snapshot_observed_at":"2026-08-10T17:18:41.308563Z","title":"Critic-V : Vlm critics help catch vlm errors in multimodal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-12T10:02:12.958369Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:41.308563Z"},"links":{"cited_paper":"/paper/2411.18203","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:dfbda918b0df73a441240669fe09d756753da2b286e28a5a3d0c26f95cdfe5b2","observation_id":"f7ccdbab-a1c1-489f-8523-1d22700a6232","resolution":{"observed_at":"2026-08-10T17:18:41.308563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2411.18203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18203","snapshot_observed_at":"2026-07-01T22:36:16.802423Z","title":"Tianjun Zhang, Aman Madaan, Luyu Gao, Steven Zheng, Swaroop Mishra, Yiming Yang, Niket Tandon, and Uri Alon","venue":null,"work_id":"b3082e74-5cb5-48b0-8b21-74ee63ae7e5d","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2411.18203","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ef33d3511716049e7164bd4d2796b703f42326e210d0aaec08d521230532b482","observation_id":"3dd5afbd-cc1f-4a06-883e-04f55644e95a","resolution":{"observed_at":"2026-05-11T05:26:05.875185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2411.18203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18203","snapshot_observed_at":"2026-07-01T22:36:16.802423Z","title":"Tianjun Zhang, Aman Madaan, Luyu Gao, Steven Zheng, Swaroop Mishra, Yiming Yang, Niket Tandon, and Uri Alon","venue":null,"work_id":"b3082e74-5cb5-48b0-8b21-74ee63ae7e5d","year":2024},"citing_paper":{"arxiv_id":"2605.16410","last_updated":"2026-05-13T14:35:22Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T14:35:22Z","title":"Test-Time Hinting for Black-Box Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T21:16:45.748116Z"},"links":{"cited_paper":"/paper/2411.18203","citing_paper":"/paper/2605.16410"},"observation_digest":"sha256:5190b0792261c29c0a257bcbbeda893f3605ae4a8b05c3acf93af8ac7bed4bae","observation_id":"f0639fcb-0b98-48d9-b284-46d6eb8d4c83","resolution":{"observed_at":"2026-05-20T21:19:03.061496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2411.18203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18203","snapshot_observed_at":"2026-07-01T22:36:16.802423Z","title":"Tianjun Zhang, Aman Madaan, Luyu Gao, Steven Zheng, Swaroop Mishra, Yiming Yang, Niket Tandon, and Uri Alon","venue":null,"work_id":"b3082e74-5cb5-48b0-8b21-74ee63ae7e5d","year":2024},"citing_paper":{"arxiv_id":"2606.01671","last_updated":"2026-06-01T04:28:44Z","snapshot_observed_at":"2026-08-02T05:29:24.680380Z","submitted_at":"2026-06-01T04:28:44Z","title":"When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T15:19:26.983760Z"},"links":{"cited_paper":"/paper/2411.18203","citing_paper":"/paper/2606.01671"},"observation_digest":"sha256:da06ee00338638a54caad4abe0d9435adf16cc968d881eb21a937727a4acffdd","observation_id":"c33ebc55-f171-4fb7-a660-b1458662dde5","resolution":{"observed_at":"2026-07-01T22:36:16.803674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18203","snapshot_observed_at":"2026-08-07T00:14:16.664589Z","title":"Critic-V: VLM critics help catch VLM errors in multimodal reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02713","last_updated":"2026-08-03T17:59:58Z","snapshot_observed_at":"2026-08-12T12:39:41.730067Z","submitted_at":"2026-08-03T17:59:58Z","title":"Quo Vadis, World Modeling?","version":1},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:16.664589Z"},"links":{"cited_paper":"/paper/2411.18203","citing_paper":"/paper/2608.02713"},"observation_digest":"sha256:5e5d8d519edbf49de66baeb18fc0d7d9557a0b5e0b07b06dfdbe8de71c2b3f82","observation_id":"534359d2-0f71-4412-8ef1-5ec5e2c6d94e","resolution":{"observed_at":"2026-08-07T00:14:16.664589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18203","snapshot_observed_at":"2026-08-12T19:56:01.975427Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10665","last_updated":"2026-08-11T08:46:38Z","snapshot_observed_at":"2026-08-13T05:24:23.517712Z","submitted_at":"2026-08-11T08:46:38Z","title":"VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:56:01.975427Z"},"links":{"cited_paper":"/paper/2411.18203","citing_paper":"/paper/2608.10665"},"observation_digest":"sha256:13887f599f1a5e3bb03b57e0bbd1bc453e704002bb9feba248926f9369ee4770","observation_id":"afc8d2b1-b606-46cd-840f-99b58920453f","resolution":{"observed_at":"2026-08-12T19:56:01.975427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18203/citation-record","integrity":"/paper/2411.18203/integrity","json":"/paper/2411.18203/citation-record.json","paper":"/paper/2411.18203"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.082475Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.082475Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:ee25c0199a92dfc940eefd7746392afb3584fa8cd8251c62e13ab824006489b3","observation_id":"034a4a1f-25b6-421c-ac16-9da194944231","resolution":{"observed_at":"2026-08-12T11:27:33.082475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-12T11:27:33.088452Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.088452Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:12b995bb5168057e32cae9696c7937151b3742753e5e192e237022a6f4b8abc3","observation_id":"8d605576-d546-41e7-a892-58bb37b3040a","resolution":{"observed_at":"2026-08-12T11:27:33.088452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T11:27:33.094064Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.094064Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:580f65d747de2eaa6925e9f4385d8afbb210c59b0c0c9c3252c094633c9250ad","observation_id":"1f148c67-6662-4cdc-bf32-6d7fac83682a","resolution":{"observed_at":"2026-08-12T11:27:33.094064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04023","last_updated":"2023-11-28T09:01:12Z","snapshot_observed_at":"2026-08-07T14:17:12.140094Z","submitted_at":"2023-02-08T12:35:34Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04023","snapshot_observed_at":"2026-08-12T11:27:33.101376Z","title":"A multitask, multilingual, multi- modal evaluation of chatgpt on reasoning, hallucination, and interactivity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.101376Z"},"links":{"cited_paper":"/paper/2302.04023","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:d3a7c110625c3b0a47c13e77302d6a64e1b0ad45b09246b1c9428cb92c33b42a","observation_id":"2167781a-0df1-4004-8d67-5b91be868b77","resolution":{"observed_at":"2026-08-12T11:27:33.101376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T11:27:33.106768Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.106768Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:eb70caea1072ded28da0dcafe92bae1bd69cac3eaddf78843e6d86b0a3f5f01b","observation_id":"d8221068-bef4-43bd-b7a2-42b5c0ed0d0f","resolution":{"observed_at":"2026-08-12T11:27:33.106768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-12T11:27:33.112655Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.112655Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:b86f13c6b34e3b02cb2a09c28e0857d25d4da4f14e636fa5d97db219e5f803ec","observation_id":"9d0e1993-dd2c-499c-a8e4-8e3114a8f8e8","resolution":{"observed_at":"2026-08-12T11:27:33.112655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.838271Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"c3fe6e64-8769-443c-be15-075197ad2736","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.118009Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:47babe4a6975b7763358a5b3085d98d03aab7153f93ad8e2ed6e7a6ff12299a8","observation_id":"be18d887-8108-4785-aca9-1caeec776a58","resolution":{"observed_at":"2026-08-12T11:27:34.843995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11007","last_updated":"2024-09-17T09:14:45Z","snapshot_observed_at":"2026-08-12T22:43:24.403050Z","submitted_at":"2024-09-17T09:14:45Z","title":"CAST: Cross-modal Alignment Similarity Test for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2409.11007","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.11007","snapshot_observed_at":"2026-08-12T11:27:34.130094Z","title":"CAST: Cross-modal Alignment Similarity Test for Vision Language Models","venue":"cs.CL","work_id":"a00a49ac-a646-4b98-ac91-0ec9983bdd9b","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.122826Z"},"links":{"cited_paper":"/paper/2409.11007","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:8b1b01c5b7e8fde5b8f2b951359faa27111cd1a087cf5b2dbdf484c1dd24b038","observation_id":"92ea7bac-5f81-481e-a256-205d9dfafc9d","resolution":{"observed_at":"2026-08-12T11:27:34.137559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.821496Z","title":"Gemini-1.5-pro, 2024","venue":null,"work_id":"bf2969a4-2434-45e8-9874-5065c18a6a47","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.128478Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:a523aa6344a30740b19293ea106f325cadeabb50fc8a2e8b7fa162e82a72a219","observation_id":"979b5fa9-23a3-4333-ae07-42be3cf973d2","resolution":{"observed_at":"2026-08-12T11:27:34.826294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-12T11:27:33.133335Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.133335Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:67ec1f8629a066044bfdbca784a88b49b2557f72aa46ae0c33cc4b89c9b09aa4","observation_id":"95a58b8a-9adb-4645-9eb8-49aa8962c5b5","resolution":{"observed_at":"2026-08-12T11:27:33.133335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T11:27:33.138054Z","title":"Palm- e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.138054Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:fefb9eb1abb57eb234d3f6909f5d6f62d1d7e1a649d9aead1eb04c3fd80d5388","observation_id":"0b954e3b-be66-4f36-a2ed-e11590f3c993","resolution":{"observed_at":"2026-08-12T11:27:33.138054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.803354Z","title":"Chatglm: A family of large language mod- els from glm-130b to glm-4 all tools, 2024","venue":null,"work_id":"d9d5c162-c3cc-41bf-ba82-d3cba99aa140","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.143614Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:1c7ac0f4163f336ec6a52ba55da72d3aabd2b3e5db32ac15ffa59338bcd672c2","observation_id":"6be69ab7-8e1b-4659-ac89-bf5ecb436ff1","resolution":{"observed_at":"2026-08-12T11:27:34.809098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-08-10T05:38:55.120527Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-12T11:27:33.148992Z","title":"Roscoe: A suite of metrics for scoring step-by- step reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.148992Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:688f8449f3ccce4469aa0f54517da5f7076ede30a6dfa9d5dd3722d8fc73893d","observation_id":"c9079af9-cc7f-4116-917a-db2bbdc4aea0","resolution":{"observed_at":"2026-08-12T11:27:33.148992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04055","last_updated":"2025-06-05T13:25:43Z","snapshot_observed_at":"2026-08-12T22:30:14.817220Z","submitted_at":"2024-10-05T06:28:54Z","title":"Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04055","snapshot_observed_at":"2026-08-12T11:27:33.153845Z","title":"Self-correction is more than refinement: A learning frame- work for visual and language reasoning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.153845Z"},"links":{"cited_paper":"/paper/2410.04055","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:52d50ed05279d4af4e52a337442fd72d4ac7614a1deb26f36d990071deac7a96","observation_id":"3731d655-9dc0-467b-a652-6bc6913c5e71","resolution":{"observed_at":"2026-08-12T11:27:33.153845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-08-13T04:22:31.609491Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-12T11:27:33.158423Z","title":"V- star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.158423Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:2189be77e0334b2c84a686fb1856e2b85e2a0e9a08f00cf904046fc9d278dc47","observation_id":"5a8f6af5-373d-4af3-b4b6-b2e5fd8a749e","resolution":{"observed_at":"2026-08-12T11:27:33.158423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.163296Z","title":"St-p3: End-to-end vision-based au- tonomous driving via spatial-temporal feature learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.163296Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:26004437ff1650c477ccae4f75b2fbe088f2810d70422dce0a44eec714b82be4","observation_id":"6860837d-de31-4a5d-947d-ed08abc4ad61","resolution":{"observed_at":"2026-08-12T11:27:33.163296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.167657Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.167657Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:76c5dbb1461939194f5f288da476b28ae7ce0959a9ed27be0875cfc5017cbd25","observation_id":"954f6cb4-c8c7-4c1f-9733-fc183994a71e","resolution":{"observed_at":"2026-08-12T11:27:33.167657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T11:27:33.173463Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.173463Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:97db62616cb549f23f86a0d7ef9beb88f98180b7201acdd24c6dbd71be89c3db","observation_id":"d5c2c2d9-f8ab-423f-b1b2-7c8658dd7850","resolution":{"observed_at":"2026-08-12T11:27:33.173463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.178940Z","title":"Vad: Vectorized scene representa- tion for efficient autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.178940Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:a8dd4cf7ef18913e8cc712eb74c79beaa9e59b9a05d373c4b6a3039a960089a5","observation_id":"efff575c-602d-41a1-8d0a-52067462f1e5","resolution":{"observed_at":"2026-08-12T11:27:33.178940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-12T11:27:33.183592Z","title":"Vima: General robot manipulation with multimodal prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.183592Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:578a95ea2099b4de7808bcef1956108056208e9529d0611e0c772698d5d37df5","observation_id":"31478b72-4aa0-4807-8de0-ab17a6049e56","resolution":{"observed_at":"2026-08-12T11:27:33.183592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.751100Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"c3edd11a-12ca-40c1-8d21-1cbeabbc6ab6","year":2022},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.189253Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:e49cdfc8410f31439f710aa17f1f9fe5b178be902dd5b66b9f2c05f916d1eea9","observation_id":"8b38f95b-ee23-47cf-ba57-cae2dcaf62b8","resolution":{"observed_at":"2026-08-12T11:27:34.756313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-08-11T00:48:03.626777Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-12T11:27:33.194094Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.194094Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:24f778e5fab51b42a6394e49c078a48d31f1dc399814e75a4fd8e96cdb462e81","observation_id":"6bb5eb8b-6966-45ff-9ac3-634d3d9238f2","resolution":{"observed_at":"2026-08-12T11:27:33.194094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T11:27:33.199026Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.199026Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:76ee1b3f40fb8a7063e615ac38e7f6f1912035db23c592c7a1f76475c3733f5b","observation_id":"1e646ab3-d26a-4239-9865-26d51064c042","resolution":{"observed_at":"2026-08-12T11:27:33.199026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-13T05:00:07.845665Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T11:27:33.204022Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.204022Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:0611d8a71342c1fe3078ec9af5b28f43941d53eba0986191d84125d2a5b60067","observation_id":"a01a592e-44bc-406f-a3c8-a5ab89e09ed0","resolution":{"observed_at":"2026-08-12T11:27:33.204022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T11:27:33.208990Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.208990Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:212051d2090a2a3327b0fc96af2262e1dda1d8843773c65abed0d5267bc0de5c","observation_id":"9f764ecb-cd88-4e22-9e05-d9beeb962bcb","resolution":{"observed_at":"2026-08-12T11:27:33.208990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-12T11:27:33.214333Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.214333Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:f2a7bf4b009efd1185e85ebad61a4e10da2f5536ae8489cec1160d44cb2a6ce0","observation_id":"52f9c951-d830-489f-9ce0-fb42c12adb18","resolution":{"observed_at":"2026-08-12T11:27:33.214333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.735511Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"1d777f3f-784c-4f8b-8aa3-6bf4e5677f83","year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.219132Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:3d7d5054bc235421a7787cc66fb953579d17324e5e2f60b448c251d5abb30b30","observation_id":"048b293e-b7d8-4666-bcab-cd50cb634d64","resolution":{"observed_at":"2026-08-12T11:27:34.740575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.223939Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.223939Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:a85b6c9a04ddf5374eb5808f2468e9c5c08229506a814accd453f4e3eb893db9","observation_id":"28aa8fb3-447d-4c19-9214-0325a9f0d193","resolution":{"observed_at":"2026-08-12T11:27:33.223939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.228945Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.228945Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:3141763626fea7821c16c04ff8b281bccd5ba875cc660665c9ed5d8679b81602","observation_id":"8bf43c82-feae-46e3-949b-2f7e1a3902c6","resolution":{"observed_at":"2026-08-12T11:27:33.228945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.697270Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":"f9e3501d-7a14-4a6e-950f-a9bac6ec4a35","year":2025},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.233647Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:6de4e04831603528cf9875ead372a58e43c64b90510526b37b786539a0e94a5a","observation_id":"422cb8f1-5374-49ab-8131-14a6d80f8491","resolution":{"observed_at":"2026-08-12T11:27:34.702876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T11:27:33.238871Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.238871Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:e28da36d8d3b7321c085d58f9f394b376b9dda89bf26c4fb89083f9b836a3278","observation_id":"a0b62837-e951-479b-bf63-bf0766baa20d","resolution":{"observed_at":"2026-08-12T11:27:33.238871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.679967Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"e6c2ba80-bb42-4b76-af98-e3662bdd860d","year":2022},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.244301Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:f7a9110971d65f66f83a9f359b13f9abc1d4317e0ca5ef37b59d111b798f0a1f","observation_id":"06df21f4-afa2-4141-b501-5b7627c19648","resolution":{"observed_at":"2026-08-12T11:27:34.685242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.248747Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.248747Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:cc0271b62b6f06aec033b03cbb4799bedab7196ccff6493ea51008b22dd1d238","observation_id":"87ede84d-8f10-41bb-a46d-ac44467b0c45","resolution":{"observed_at":"2026-08-12T11:27:33.248747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.646647Z","title":"Self-refine: It- erative refinement with self-feedback","venue":null,"work_id":"ec9c4627-6e75-4714-a0a1-9a8f42be7d09","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.255007Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:50a5cb11b6d9374782c968d0c256a2eff035de3e55660f68e0d887828e3b8122","observation_id":"6495c531-cf02-4d26-9b78-8d16ed8d249f","resolution":{"observed_at":"2026-08-12T11:27:34.652549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-12T23:32:25.133777Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-12T11:27:33.259690Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.259690Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:dfe48bb04a355084270565c8c18dce0ff75355445e403a3d433727ed822e0c4b","observation_id":"8d63ecfa-947c-4889-b4fe-80eec2bde86e","resolution":{"observed_at":"2026-08-12T11:27:33.259690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.628099Z","title":"Llama-3.2-11b-vision, 2024","venue":null,"work_id":"bb4b8f6b-35e2-431f-a058-c19c0c74d2c3","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.264863Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:bc40f63a89e6cbc90582cca31ee1779645ab0e55121de2a18a1c09f7feccddbd","observation_id":"c2bc84c7-b20a-4dd5-bcf5-f641e5a9f4e6","resolution":{"observed_at":"2026-08-12T11:27:34.633589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01111","last_updated":"2024-11-02T02:22:21Z","snapshot_observed_at":"2026-08-12T22:09:21.291029Z","submitted_at":"2024-11-02T02:22:21Z","title":"Rule Based Rewards for Language Model Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01111","snapshot_observed_at":"2026-08-12T11:27:33.269702Z","title":"Rule based rewards for lan- guage model safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.269702Z"},"links":{"cited_paper":"/paper/2411.01111","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:7fef683b5f7d6f34dce2816f0b7127d722a9ac0693d8194d0c0e54a7e22d4c75","observation_id":"e3d8be13-5f55-4c14-9033-84d6af8a8726","resolution":{"observed_at":"2026-08-12T11:27:33.269702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.610448Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":"39d3e653-979d-4b58-829c-1007d1cfabfb","year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.274830Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:bf7d463f53c690399ae7151556e21a5ab694d3e15a8f54e0d1d7042c6fb7a880","observation_id":"d1ecdada-f367-49fc-b211-fecd9b6778f8","resolution":{"observed_at":"2026-08-12T11:27:34.615390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.592386Z","title":"Hello GPT-4o","venue":null,"work_id":"e1cd15d8-3742-403c-9f98-d717a56be21a","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.280224Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:7320d0f154558b26dbc793bcf991599e777b097f51b04fdd5054df7b7986e8b6","observation_id":"ba6bca92-4df6-40ab-8c03-ec2b0de626d0","resolution":{"observed_at":"2026-08-12T11:27:34.597694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.285300Z","title":"Gpt-4o mini: advancing cost-efficient intelligence,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.285300Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:a471fb758979d41713577519d075453f5bfd5a06aa214e47fe2aee64ba62cee7","observation_id":"4ab1b5ae-9ce7-4de7-bf41-ed108ee4c08f","resolution":{"observed_at":"2026-08-12T11:27:33.285300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01904","last_updated":"2024-02-04T12:15:18Z","snapshot_observed_at":"2026-08-12T02:58:43.877304Z","submitted_at":"2023-04-04T15:57:28Z","title":"REFINER: Reasoning Feedback on Intermediate Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01904","snapshot_observed_at":"2026-08-12T11:27:33.295813Z","title":"Refiner: Reasoning feedback on intermediate representa- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.295813Z"},"links":{"cited_paper":"/paper/2304.01904","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:751bea38b104498d63b78dd7713421cb081bcdc3942c101f20adbf8bfce55848","observation_id":"58cc6361-bb9f-4fd6-a1d4-e57357a9388f","resolution":{"observed_at":"2026-08-12T11:27:33.295813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.546769Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"20f7c81f-508a-437c-a78b-b0a145a92698","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.301581Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:b983f38e852a9217d0d1832917e917187d2f10c0dc946bf6dd3dd20c07a2ac6d","observation_id":"d29ed5ec-50d7-43f7-9572-3f24f6753b9d","resolution":{"observed_at":"2026-08-12T11:27:34.552174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.528315Z","title":"Deepspeed: System optimizations enable train- ing deep learning models with over 100 billion parame- ters","venue":null,"work_id":"ffc735f7-ec83-417d-91c5-9262f06289b2","year":2020},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.306734Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:7b405d539d929f2deefbd06999db665dbd1bd8109fae2975c2e85691f9788bb3","observation_id":"78046100-131f-421f-9de1-8f0bbfb6e49c","resolution":{"observed_at":"2026-08-12T11:27:34.533861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.511965Z","title":"Learning to summarize with human feed- back","venue":null,"work_id":"5f5cef9d-18b8-4889-a237-b22ebd1722dc","year":2020},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.311992Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:38d404321569c62e34a5246b9e93e90b2022c778548f2e63e6b04a53b6c6dd76","observation_id":"e0cf320e-7c19-4f4f-bc7b-83ce7c498fbf","resolution":{"observed_at":"2026-08-12T11:27:34.517214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-12T11:27:33.316975Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.316975Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:a7d648c71f6e8d8c3b9611490f8afec681ab1d53b46dfa994d34e231b9b602bb","observation_id":"3c94c04f-de9e-4a45-b91e-7bfca6409f05","resolution":{"observed_at":"2026-08-12T11:27:33.316975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.490739Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"f2752e36-86a2-49da-839e-247bf74014d7","year":1999},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.321810Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:fd341f59509e06c7d452137325375f21e451999ece6c62f9d9c9d2e86101822a","observation_id":"266575a5-ea79-44cc-91ad-8395ae060719","resolution":{"observed_at":"2026-08-12T11:27:34.498472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T11:27:33.326629Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.326629Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:ad091e6862b7422e11c8c5c555fefb2ab8df722b1ffd5e52cfcdf8236ddc0bb7","observation_id":"f02a630f-3b4c-44b0-83de-099917c43c33","resolution":{"observed_at":"2026-08-12T11:27:33.326629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08516","last_updated":"2024-06-04T10:25:13Z","snapshot_observed_at":"2026-08-13T05:25:16.917606Z","submitted_at":"2023-11-14T20:12:38Z","title":"LLMs cannot find reasoning errors, but can correct them given the error location","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08516","snapshot_observed_at":"2026-08-12T11:27:33.331621Z","title":"Llms cannot find reasoning errors, but can correct them given the error location","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.331621Z"},"links":{"cited_paper":"/paper/2311.08516","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:88f4e26a71d71db9100903799a3de12e0e087c23201743425c4bc02d8e9c64d0","observation_id":"2bbdabe7-3460-4516-b7d9-ab3ac4b6feea","resolution":{"observed_at":"2026-08-12T11:27:33.331621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T11:27:33.337313Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.337313Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:5fe8619ea136cbf094c770e05b66861e5c8672e0974d553a125ee561320ebf7f","observation_id":"db7a87f6-8cf6-4d55-818b-9e8a057a47ef","resolution":{"observed_at":"2026-08-12T11:27:33.337313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-12T23:58:23.908585Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-12T11:27:33.342823Z","title":"Enhancing visual- language modality alignment in large vision language mod- els via self-improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.342823Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:7e70de0241640f179112ac8d4aebdb4d635800529d9b0238b5099054a75fb3e1","observation_id":"17cfad8e-0140-4bac-9f76-730c358064b0","resolution":{"observed_at":"2026-08-12T11:27:33.342823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:33.348467Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.348467Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:5fe1372457277cd83ea07af7c67d7f785d0f6db3c85e36f94038194e9887e565","observation_id":"5b9e669a-383e-4016-9fcc-099afb58f0ed","resolution":{"observed_at":"2026-08-12T11:27:33.348467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17820","last_updated":"2025-05-31T02:41:34Z","snapshot_observed_at":"2026-08-12T23:56:32.423489Z","submitted_at":"2024-05-28T04:40:57Z","title":"Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17820","snapshot_observed_at":"2026-08-12T11:27:33.353133Z","title":"Don’t miss the forest for the trees: Atten- tional vision calibration for large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.353133Z"},"links":{"cited_paper":"/paper/2405.17820","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:b798fe098ea4ad83f2583796bcf627ec83b7667c46e60725142f6504ce2979cc","observation_id":"917ed366-babe-4e96-b341-d5776162cc89","resolution":{"observed_at":"2026-08-12T11:27:33.353133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.458786Z","title":"Grok-1.5 vision preview, 2024","venue":null,"work_id":"1d9d4cca-737d-4efa-a2ad-9ef656879752","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.358203Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:0e7912709d853a14870639f5fe24276211b3517089aba7b9a453ae64fef20633","observation_id":"bfaeb753-cdcd-4070-aee9-6197022b293e","resolution":{"observed_at":"2026-08-12T11:27:34.464735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-12T11:27:33.363118Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.363118Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:51fb3a38dbfcc91876edad639d13b88707b4c2f6ff355b37bd7f9d58a1e00e34","observation_id":"710f667f-063a-44ce-8c8e-4465ef4a39c5","resolution":{"observed_at":"2026-08-12T11:27:33.363118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.440658Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"80ea9536-772a-4934-b0a0-58b51deb3f38","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.368550Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:fe5d9207231658d5544fc55a67ab4fd6c75da260459685ac22d8905e30f4b254","observation_id":"1087fa5c-e965-4048-83aa-9e4506dd8fe0","resolution":{"observed_at":"2026-08-12T11:27:34.446738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19094","last_updated":"2024-07-18T06:53:22Z","snapshot_observed_at":"2026-08-13T00:43:22.211158Z","submitted_at":"2024-03-28T02:12:49Z","title":"Learning From Correctness Without Prompting Makes LLM Efficient Reasoner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19094","snapshot_observed_at":"2026-08-12T11:27:33.373868Z","title":"Learning from correctness without prompting makes llm ef- ficient reasoner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.373868Z"},"links":{"cited_paper":"/paper/2403.19094","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:1405412038f407c634ecbf37e601985c2491f49f53472d34a5624a6206f9a824","observation_id":"0625d111-4cbe-4aba-8ce7-1f3acee4675c","resolution":{"observed_at":"2026-08-12T11:27:33.373868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T11:27:33.379680Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.379680Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:21ccad3b1a438ec4e3631d0192762b146895fd74b25e9915af45fb80901bc5b3","observation_id":"10c014a5-3ca3-4a3a-b5d6-c94b48c9adc5","resolution":{"observed_at":"2026-08-12T11:27:33.379680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.422727Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi, 2024","venue":null,"work_id":"90eabb37-1885-4d74-8d7b-a3e5242bf9f3","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.385690Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:67a6e65cae0440ad1ebe598c866084330e10f15ab769abff643b20a38f885083","observation_id":"aa5b0aad-32cf-48c4-b16c-0316c66d5e4d","resolution":{"observed_at":"2026-08-12T11:27:34.428259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-08-13T02:15:58.634561Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07496","snapshot_observed_at":"2026-08-12T11:27:33.390355Z","title":"Textgrad: Automatic” differentiation” via text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.390355Z"},"links":{"cited_paper":"/paper/2406.07496","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:d17333adbdcaacdbce9470419386c1ac7ed675e8dd6e60232bd760998347c3f0","observation_id":"b9a1de13-d079-48e7-ad42-73c40f21d99b","resolution":{"observed_at":"2026-08-12T11:27:33.390355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-08-12T23:45:25.243322Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-12T11:27:33.397485Z","title":"Accessing gpt-4 level mathemat- ical olympiad solutions via monte carlo tree self-refine with llama-3 8b: A technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.397485Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:161ab929c238f74f100ef6213188103942e1ca40be7cf7728e210a957a234da6","observation_id":"bde391a1-1fb1-4797-91be-ec23c524300c","resolution":{"observed_at":"2026-08-12T11:27:33.397485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-12T22:31:19.889900Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-12T11:27:33.403459Z","title":"Llama-berry: Pairwise optimization for o1- like olympiad-level mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.403459Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:e8f61137acb35bc98c1ff005ccd6d2edb810adf61c223f739c532e414440d4aa","observation_id":"4c064ee6-a811-4e7e-87f3-006990c4a0b1","resolution":{"observed_at":"2026-08-12T11:27:33.403459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-12T11:27:33.408895Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.408895Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:8154f35841f13632b3047cf3144f52a8377907d8954a75ebf1986eac024a877c","observation_id":"a8d72bef-65e9-4fce-9748-e725d2b3ee7a","resolution":{"observed_at":"2026-08-12T11:27:33.408895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-12T11:27:33.414817Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.414817Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:753e809ed1d54c2784d1929e85c2077e100fa89e46cb64a7a35b27d6c1f5d7a6","observation_id":"b0448ac7-50ff-4f4e-92e1-a6e1e4d13b76","resolution":{"observed_at":"2026-08-12T11:27:33.414817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-12T23:40:40.908503Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-12T11:27:33.419523Z","title":"Spa-vl: A comprehensive safety preference alignment dataset for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.419523Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:aaf0300f4d8531c6f2ce94d69aa3a9b71658f1109157e5c257df081bb18f3ebf","observation_id":"191d3506-af80-45c3-a24a-ad877de06601","resolution":{"observed_at":"2026-08-12T11:27:33.419523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-12T11:27:33.424887Z","title":"Automatic chain of thought prompting in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.424887Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:ec01f66c605aad95a5822b4ae6bf0b150bfb7cbc106f909e662fc147419d3b0e","observation_id":"763db4c7-4943-45db-9dd3-d365522f91a6","resolution":{"observed_at":"2026-08-12T11:27:33.424887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-12T11:27:33.430241Z","title":"Aligning modalities in vision large lan- guage models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.430241Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:9e3a99e436d473a3bd48b50e3ba4eee4ea8e7cc7ff020d023ff1006b9fa80792","observation_id":"2cec8827-945a-465a-b57d-ed01b74ed74b","resolution":{"observed_at":"2026-08-12T11:27:33.430241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-13T02:44:39.936004Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-12T11:27:33.435515Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.435515Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:18e8a7c8c8dfdd1033c04edafe0e93c351c7a7a133884a61023b9a9769b90184","observation_id":"14067b64-e3d4-4320-8f78-261170d301f2","resolution":{"observed_at":"2026-08-12T11:27:33.435515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T11:27:33.441121Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.441121Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:39fa816c0266060a04628f664289ab2e85f78bb47b3a7937753d4c0cf70cd517","observation_id":"221d1c84-03bf-489e-a144-4c5434667161","resolution":{"observed_at":"2026-08-12T11:27:33.441121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.405168Z","title":"VGA: Vision GUI assis- tant - minimizing hallucinations through image-centric fine- tuning","venue":null,"work_id":"54d3e759-0274-4006-9c33-152dd295799a","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.446544Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:ed509cc115d2d67686ea4f06fbc0dcbfc2d855affab5e35f234997fca6616c74","observation_id":"6a56b08c-c0b5-4c9d-9001-1f9b8121916e","resolution":{"observed_at":"2026-08-12T11:27:34.410929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.385966Z","title":null,"venue":null,"work_id":"6edd6e7d-d078-487f-8fc4-fb2c9ce85910","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.451714Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:e83dea1b38f059e4eb59037770e2c389701284dec7ee1b932f79e960455a40fb","observation_id":"e3b08c04-0c7e-447f-baba-6f68ca9d0e44","resolution":{"observed_at":"2026-08-12T11:27:34.390545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.368581Z","title":null,"venue":null,"work_id":"b7e39fc1-50d1-4c76-b5fa-ad902eb14b66","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.458625Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:c19e17d0778e74428dc614257fed95171bd351cc60c8652b676cc77140079272","observation_id":"99993b3a-981e-4019-bf0f-125bb30f6618","resolution":{"observed_at":"2026-08-12T11:27:34.374596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.344472Z","title":null,"venue":null,"work_id":"7cb9ac49-60f6-4d1f-85a9-6cd383bbdb58","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.465299Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:e9d8275e1071273a301b43ed94cf31f66178dcec79090211fa7ebee86f60610d","observation_id":"f0b1f474-4668-44e5-b06c-db83442fcaa3","resolution":{"observed_at":"2026-08-12T11:27:34.356708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.325501Z","title":"For preference-aligned fine-tuning, we utilize Direct Preference Optimization (DPO) on 29,012 samples from the critique- VQA dataset","venue":null,"work_id":"2768b817-e618-4463-9585-137049410fe0","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.471122Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:2fa6c80f41fc0cf29265004326fa3928acf52ef8dcf97757839693e0a61791f7","observation_id":"48cc2e8b-a86b-46e1-a840-d6ab3448261e","resolution":{"observed_at":"2026-08-12T11:27:34.332142Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.306469Z","title":"In this section, we will list out the hyperparameters we choose for evaluation","venue":null,"work_id":"31ba507e-aa8c-46a6-a87d-214851900bd8","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.475936Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:15f913e332d4de387dcbbffda17e1686baa1e155be6d2b06621a35ef857e1e99","observation_id":"19a48ded-338b-493e-a1e1-4d160a218afe","resolution":{"observed_at":"2026-08-12T11:27:34.311708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.289739Z","title":null,"venue":null,"work_id":"c5a3f1c8-0c57-4d48-a2f4-10b23a01f947","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.480557Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:6189ffba19994dd5ba1ecfb54ee83a299fb44123fdae225c8d1933e600c84d9a","observation_id":"470ff0d4-673e-42dc-94da-807a7963785c","resolution":{"observed_at":"2026-08-12T11:27:34.295105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.264952Z","title":"You can find them in Figure 6, Figure 7 and Figure 8","venue":null,"work_id":"beee9529-854f-4904-bc1f-326bebe578fb","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.484764Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:d5765df940125ea83377f1ae1334d955ffb50b2d06ddf2a7c6f07556779e3ce3","observation_id":"1e61a02c-5122-4f37-a31c-9e03ba72aab7","resolution":{"observed_at":"2026-08-12T11:27:34.274023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.248104Z","title":null,"venue":null,"work_id":"c1f8a111-d3c8-4f8e-9c10-60a398ec2022","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.489216Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:0c80f8414dac928c961057355d0fe9d1ac910f5e63aac2501fb651f1e81e3f1a","observation_id":"1a395061-503d-4360-aaf8-4d1ae46dc235","resolution":{"observed_at":"2026-08-12T11:27:34.253077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.231616Z","title":null,"venue":null,"work_id":"150921ca-fe9f-4b77-a586-e2595db01718","year":null},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.494574Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:c8ca1d4dca5e1e12ce501a277191ed80eb0460a04a9f07ce488799ce27af8e0b","observation_id":"e39a1e81-85d4-441c-b558-f7f657f6c09f","resolution":{"observed_at":"2026-08-12T11:27:34.236407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:34.563936Z","title":null,"venue":null,"work_id":"43d556e8-48fb-4b32-ac3d-00bd2ced899c","year":2024},"citing_paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T11:27:33.290232Z"},"links":{"citing_paper":"/paper/2411.18203"},"observation_digest":"sha256:7930e9a62be145abeb53215c1d375aa6a27434ee229ed93383ea17c87a98c7fc","observation_id":"84196f46-7d29-4e07-98c6-98ff17b6ef59","resolution":{"observed_at":"2026-08-12T11:27:34.569322Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18203","last_updated":"2025-04-23T17:46:47Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:20:08.918744Z","submitted_at":"2024-11-27T10:28:57Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":55,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 6 inbound Pith citation observations for arXiv:2411.18203."}