{"as_of":"2026-08-13T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49a5915294d3640223c1d668608ae84544146d0e19bebdc28d6fc1bd55cb9b91","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:15:45.548297Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T15:05:21.907878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:08:02.074896Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"cited_work":{"arxiv_id":"2412.04903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04903","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eaco: Enhancing alignment in multimodal llms via critical obser- vation","venue":null,"work_id":"7688aa17-7dbb-4401-aaa9-f8882dab55a2","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-11T15:47:37.451369Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2412.04903","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:74f8b0f40325937ddc55a8f0eb0e2e1bb25f5f7b436e044186f3c275ca272bfb","observation_id":"822144ed-1b63-4e98-b397-83b8525ce130","resolution":{"observed_at":"2026-05-16T15:08:02.076951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04903/citation-record","integrity":"/paper/2412.04903/integrity","json":"/paper/2412.04903/citation-record.json","paper":"/paper/2412.04903"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T21:15:45.192262Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.192262Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:d73e31165db0541c7af2d136b2189d61432e026bf670eebc44a2b67ff7ab5b1e","observation_id":"c20a20e2-9235-4bb3-8daf-3390873d5016","resolution":{"observed_at":"2026-08-11T21:15:45.192262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T21:15:45.198801Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.198801Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:7f58b578f1ee3bb09110fe8b4836598ae803087d70d7eb2777e936dd8d84efe1","observation_id":"cfa5f7cc-b9ea-44ce-b6da-5432b3cd586a","resolution":{"observed_at":"2026-08-11T21:15:45.198801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.204734Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.204734Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:11608bce3b20bf8ce39465714aa0165da727575ac89d0019fbb8f490b38e0d09","observation_id":"6075f1ff-8257-44bd-b27f-71af6e04cae8","resolution":{"observed_at":"2026-08-11T21:15:45.204734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02564","last_updated":"2024-11-11T11:46:16Z","snapshot_observed_at":"2026-08-12T22:07:52.652654Z","submitted_at":"2024-11-04T19:55:32Z","title":"Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02564","snapshot_observed_at":"2026-08-11T21:15:45.210468Z","title":"Continual llava: Continual instruction tuning in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.210468Z"},"links":{"cited_paper":"/paper/2411.02564","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:05db72a364c95ad7208751ecb8d455dcf5d51762d2f5dbccde50c5be61a7749f","observation_id":"c4122eb2-7ede-4595-85b8-ff6065f0956c","resolution":{"observed_at":"2026-08-11T21:15:45.210468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T21:15:45.215944Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.215944Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:d47f3632774d361b8ff446cb6a6a64d2ab74a769733c872195f1c8a44daa448c","observation_id":"7531db02-af9a-4a18-b63e-6703c14ef1b4","resolution":{"observed_at":"2026-08-11T21:15:45.215944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15527","last_updated":"2024-02-21T07:09:58Z","snapshot_observed_at":"2026-08-13T04:13:57.403682Z","submitted_at":"2024-02-21T07:09:58Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15527","snapshot_observed_at":"2026-08-11T21:15:45.221696Z","title":"Pca-bench: Evaluating multimodal large language models in perception-cognition-action chain.arXiv preprint arXiv:2402.15527, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.221696Z"},"links":{"cited_paper":"/paper/2402.15527","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:1f4e32fbede34028fbe4e4bf26f4a67e3582873bd62399062206db8111a7316c","observation_id":"7bfe13d4-debb-4035-b2ac-03525b209723","resolution":{"observed_at":"2026-08-11T21:15:45.221696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T21:15:45.228427Z","title":"Lawrence Zit- nick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.228427Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:b86519240aa81d9ffed1366f6960d1380e60d08ffaafa822682b7e575b82187c","observation_id":"064bd64b-b1a0-49fd-9e69-17caf8363ac1","resolution":{"observed_at":"2026-08-11T21:15:45.228427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T21:15:45.235243Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.235243Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:26496f62e2562bf6933dc5976b0e7a4ada18a8514c796fed1dc23529b68a7787","observation_id":"afab7f37-2681-4a98-b2e9-bb74ac27b656","resolution":{"observed_at":"2026-08-11T21:15:45.235243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T21:15:45.241288Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.241288Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:c9affbd1b9dd93693e2d2693fb285a6da01da63d80f7a7964767fefa70cae7a9","observation_id":"900be8f2-8b35-4dfd-9cba-ace4b33dd605","resolution":{"observed_at":"2026-08-11T21:15:45.241288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19716","last_updated":"2024-11-24T03:47:38Z","snapshot_observed_at":"2026-08-12T23:54:33.713097Z","submitted_at":"2024-05-30T05:53:49Z","title":"Enhancing Large Vision Language Models with Self-Training on Image Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19716","snapshot_observed_at":"2026-08-11T21:15:45.246901Z","title":"Enhancing large vision language models with self-training on image comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.246901Z"},"links":{"cited_paper":"/paper/2405.19716","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:84f7bf9b10e5c8cd74bc5c1a212d58d8c7f10c0ded681e641ef40694a1ad6788","observation_id":"9d0e3942-1d76-4462-b1b4-731178172ab8","resolution":{"observed_at":"2026-08-11T21:15:45.246901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01487","last_updated":"2025-02-05T09:06:42Z","snapshot_observed_at":"2026-08-13T05:34:06.072475Z","submitted_at":"2023-11-02T15:36:12Z","title":"What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01487","snapshot_observed_at":"2026-08-11T21:15:45.252677Z","title":"What makes for good visual instructions? synthesizing complex visual reasoning instructions for visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.252677Z"},"links":{"cited_paper":"/paper/2311.01487","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:53709e281fee90e4030a67284d7f9aab49ffdf8cc6079eebf35fd8d8e1177444","observation_id":"278c5dde-25c1-4f08-abba-8d176d3e2e4a","resolution":{"observed_at":"2026-08-11T21:15:45.252677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.874127Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"813c60b0-b51b-4e67-b425-397d95a1428d","year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.259223Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:11d06bb17ed2562f86c4836a6230ec88c9facf5848545e50eac44db603c18f70","observation_id":"399e962d-1baf-4ad7-9d1d-5d50926b6b24","resolution":{"observed_at":"2026-08-11T21:15:46.879880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T21:15:45.264403Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.264403Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:dece29a60beb4a644db86e65144c496118f22146a92e8e8496113c0ce9bfb256","observation_id":"be302331-927a-466f-8a70-b0f5d69dee51","resolution":{"observed_at":"2026-08-11T21:15:45.264403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T21:15:45.270537Z","title":"Hallusionbench: An advanced diag- nostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.270537Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:8ee2b77e72908e10b9331424a6156fcdfdaf86d93379dcd6dc04d028a0f86947","observation_id":"869f7c6d-08f2-4dd3-8008-560deda00da0","resolution":{"observed_at":"2026-08-11T21:15:45.270537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-13T04:16:46.302787Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-11T21:15:45.276775Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.276775Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:1bebdfa5001f95d25cd256b255dcf2123d5c27d00d6de96b1facbc71d44ea93b","observation_id":"47b76b57-8d5f-4f02-a2b6-6ebd0eaad57c","resolution":{"observed_at":"2026-08-11T21:15:45.276775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T21:15:45.282235Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.282235Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:718a2f6c7205f7ade77d9bc1ea3df4b59e792d92d9825d0aa47195946ee3c598","observation_id":"14d1d624-dfba-4e20-94fb-6fb692d2dfdf","resolution":{"observed_at":"2026-08-11T21:15:45.282235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T21:15:45.288162Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.288162Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:05616d1dac932bfcc7d3e5a83225bbf31a43ee6a0c25e9a6eb50ff28df40346d","observation_id":"173b546f-be86-4f94-a87c-7f56937a687a","resolution":{"observed_at":"2026-08-11T21:15:45.288162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-11T21:15:45.294591Z","title":"Llava-med: Training a large language- and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.294591Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:90c21e520f8da6f8f4a5e30e23d9b57582a7f2749403608d06ec5cd3a4dd4998","observation_id":"c0ca5f28-10e4-461c-91b1-241142baa4e9","resolution":{"observed_at":"2026-08-11T21:15:45.294591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T21:15:45.300584Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.300584Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:e54119ac29c6b1e9a7013f2512cc2748ddf0afeeff678700b9f3297fd7e93c5f","observation_id":"f8238795-5298-42c2-962a-696a6a35e620","resolution":{"observed_at":"2026-08-11T21:15:45.300584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-13T05:00:07.845665Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-11T21:15:45.306173Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.306173Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:ddcb0dfde61a46e85f46ae156e6495b1e4c4d3e0863d80ff90719189c3936021","observation_id":"752bf7ef-9dcf-48ea-a232-c45f7efea877","resolution":{"observed_at":"2026-08-11T21:15:45.306173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-13T11:22:39.882259Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-11T21:15:45.311788Z","title":"M3it: A large-scale dataset towards multi- modal multilingual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.311788Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:74e94541542e4421c155dd8de46126997d07f11ea930a80ebf9b20700d57055d","observation_id":"f2837536-35ff-452f-816f-8af47781f5a6","resolution":{"observed_at":"2026-08-11T21:15:45.311788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12915","last_updated":"2024-01-23T17:07:18Z","snapshot_observed_at":"2026-08-13T04:36:46.757511Z","submitted_at":"2024-01-23T17:07:18Z","title":"Red Teaming Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12915","snapshot_observed_at":"2026-08-11T21:15:45.317341Z","title":"Red teaming visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.317341Z"},"links":{"cited_paper":"/paper/2401.12915","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:f4382ed6196e82a0a0abb44a00fa346309bfe26cb90d69a27cad59122f9e9972","observation_id":"50dcb1f3-f1c9-4d1a-8f0d-c8ef8a333b65","resolution":{"observed_at":"2026-08-11T21:15:45.317341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T21:15:45.322691Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.322691Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:edba2579696c59507d066106dd00aa7fc3017765c2684c35e6fffbaca1cdcdfa","observation_id":"1a7c7d87-f8d3-4c01-9b31-ecfd53584c39","resolution":{"observed_at":"2026-08-11T21:15:45.322691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-11T21:15:45.328671Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.328671Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:7832c1dfc2a8cb5f1ebc6a87ce01e6c3ba4febc86f01fe45afdf8ddbf6602d7e","observation_id":"ff5a77d4-9051-48a1-b6fe-b71348d67325","resolution":{"observed_at":"2026-08-11T21:15:45.328671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T21:15:45.334538Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.334538Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:f5656d46d87e04ae9610c4aa119250e9b018fa331c6cc0c1f777e45f0767ba1f","observation_id":"a89266fe-bff0-40d3-badf-f235576c5d77","resolution":{"observed_at":"2026-08-11T21:15:45.334538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.341133Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.341133Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:d8d051088837fdabd2f84a1aacf98a7fd632fda8b0ab4d9451b74621248695b4","observation_id":"969ef877-2a1a-4ec9-b1f6-bb1c97f6f50a","resolution":{"observed_at":"2026-08-11T21:15:45.341133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-13T12:48:26.884823Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-11T21:15:45.347819Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.347819Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:b48738814b5b568f8ed77ee2915831c7bf1b3dd03013095a6395dd2df6ebdc19","observation_id":"e2418008-9e24-4709-b8b6-79ba61956036","resolution":{"observed_at":"2026-08-11T21:15:45.347819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.844486Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"f99c465a-2ae6-4a0c-b566-a81583a3079b","year":2022},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.353023Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:dc5f7da2a09cb6c36068c247c346e72bc7e6cbc394e81c7a75c6b7fa4da5a668","observation_id":"689856cc-c6a7-4f5a-9617-d0f9a1bcdc0d","resolution":{"observed_at":"2026-08-11T21:15:46.850399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.359223Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.359223Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:e4071f0a4804853a4a61e719c43811920f777255ff39652bd0fcee4051155377","observation_id":"9bc3d518-bdfe-4e85-a664-19494be0f3b7","resolution":{"observed_at":"2026-08-11T21:15:45.359223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T21:15:45.364993Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.364993Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:51e02d4c7008949413954e0fd6f0f166f90aefa99a7a2308e9a56e76265ff617","observation_id":"3c91929f-c41c-443e-bb96-11fdea8b1140","resolution":{"observed_at":"2026-08-11T21:15:45.364993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T21:15:45.371287Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.371287Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:a31cd2bcd36e381e90759da652c67dc7c91ef4c6cedd78baa540ec3abd1d9ed9","observation_id":"5bcec186-4edc-48ce-a99a-56c5c1b823e5","resolution":{"observed_at":"2026-08-11T21:15:45.371287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.377436Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.377436Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:0c22d8459cedf8f4738cfa91e9e21d748fc6fa660d121929e35a26d4cb3b1f02","observation_id":"a9ec3eef-ea7b-4fd0-b9a4-b9e280f06b30","resolution":{"observed_at":"2026-08-11T21:15:45.377436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.382777Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.382777Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:35959433fa6ba5c2c5508f02667904f4ba48c34a817f3648c3bfced9e4979bd5","observation_id":"539e37b4-d317-4ea6-8ea7-4cc0bc67d028","resolution":{"observed_at":"2026-08-11T21:15:45.382777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.792942Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"7c572e70-4bdf-4207-a3a3-7ae4ec9066ed","year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.388405Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:d8be8b2ea19146c30bb1ba1052f3ff32568b3f5f5a31b47c8141768148a9825e","observation_id":"46b8b64a-4161-4b9b-b325-50fc5e150257","resolution":{"observed_at":"2026-08-11T21:15:46.798944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T21:15:45.393913Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.393913Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:829759cc5a18d43857909930a65c1e3245d4b120161d581fb5da25a64f12863d","observation_id":"d66c0994-55d1-4555-9588-607c3c1e22e7","resolution":{"observed_at":"2026-08-11T21:15:45.393913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T21:15:45.399783Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.399783Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:b7cefbc3b4c3a53fedc8ef503955671c2c08a8af3ca446642ed49341808bc6c4","observation_id":"0a179c69-c0b6-4d63-8011-d0a23245e2af","resolution":{"observed_at":"2026-08-11T21:15:45.399783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T21:15:45.405958Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.405958Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:fd4723a1a4c13be9674532d05225515ab86a4db87a6914824c561fe77c826bb7","observation_id":"f9d311ea-0459-4edd-9201-2f7766722622","resolution":{"observed_at":"2026-08-11T21:15:45.405958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.774953Z","title":"Eyes wide shut? exploring the 10 visual shortcomings of multimodal llms","venue":null,"work_id":"a406b5ea-e8f5-4ea7-ba45-ea1087d1e8d9","year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.411814Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:c8f1c7d731417834787375a5438e6dfd1614b7e07cd7ad2615a64713d0ba0674","observation_id":"ec515631-2aea-4330-9deb-950b9b20bb3e","resolution":{"observed_at":"2026-08-11T21:15:46.780892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-11T21:15:45.416910Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.416910Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:9e4690fa1c3c50e26c82ddc8dd08e3aa89b28acb7ac3bd2fb4280c54b7a74951","observation_id":"a8c18b14-d571-498e-94b0-8c673eaac303","resolution":{"observed_at":"2026-08-11T21:15:45.416910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-12T23:58:23.908585Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-11T21:15:45.422147Z","title":"En- hancing visual-language modality alignment in large vi- sion language models via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.422147Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:df55732438f2489740f7c597f2b3607f65c3e6c3b9f69bf2f06219c683103ea3","observation_id":"b781e7cd-e719-4fb8-bdf5-c8ba61f9eb03","resolution":{"observed_at":"2026-08-11T21:15:45.422147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T21:15:45.427816Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.427816Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:1327ae547cc6cc5f2f5377b4484a7bdba597a367b2872fb4e511bf68f7461285","observation_id":"b5dd3bf9-8510-42d6-8dd5-0c174b40ebe7","resolution":{"observed_at":"2026-08-11T21:15:45.427816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.757414Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":"c522c59a-07fe-4ebf-be25-9170e5a07d62","year":2022},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.433882Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:614aeb655c0dee7a530b574d6f06f329c70e4a3962c4121f8f89dcdaa76d445a","observation_id":"90bd0078-f692-4549-91bd-85fda6748089","resolution":{"observed_at":"2026-08-11T21:15:46.763059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-12T22:31:25.254904Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-11T21:15:45.439011Z","title":"Llava- critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.439011Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:99f429db7f4a7e6bbbe270880852a2f2317c9cbdc21cc9873891ef47a2c1ea0f","observation_id":"673ab646-95d2-4282-8bbc-bc16281423d8","resolution":{"observed_at":"2026-08-11T21:15:45.439011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.444343Z","title":"Vigor: Improving visual ground- ing of large vision language models with fine-grained reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.444343Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:ea2e3029327ef79bd2d51fb57f9a0392921f03020f04eb4aee44f41a2f6ddb6d","observation_id":"f319dd1b-8512-41cd-9fe4-7f8eedb838b4","resolution":{"observed_at":"2026-08-11T21:15:45.444343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T21:15:45.449491Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.449491Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:a38390ceb2761e0862dd91b4b51f4b042f4e6b9564992863346679e428e1c933","observation_id":"6e3e43e3-f35b-4de7-a02d-cb4cad39ea32","resolution":{"observed_at":"2026-08-11T21:15:45.449491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.739487Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional hu- man feedback","venue":null,"work_id":"3c4735eb-ed36-43d1-88ce-ab33e505fb3d","year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.455553Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:1801c03d5bc8e6cb7913ceb7e4f840d4c03abee803f5aa175819ceceb13e86a4","observation_id":"1039a7d5-e991-4703-94d3-df29571e1b96","resolution":{"observed_at":"2026-08-11T21:15:46.745492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:45.460464Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.460464Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:35215d397cf576652cffca08e9cfa84ed34a4e65ce424387fb685e271aa85c15","observation_id":"d9c0d487-ee6f-4416-a2bc-58167ce97727","resolution":{"observed_at":"2026-08-11T21:15:45.460464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-11T21:15:45.466231Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.466231Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:67bb52aaff43e685fc1b61236348226dd06092ec710e2879e8e55bfb64fcf97f","observation_id":"a3255b99-0504-4be1-867f-244dfc44a424","resolution":{"observed_at":"2026-08-11T21:15:45.466231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-11T21:15:45.471772Z","title":"Pmc-vqa: Vi- sual instruction tuning for medical visual question answer- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.471772Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:355b72405293447deb27b7cef672174383ad9b4169e69c7cf873e070adbdd05e","observation_id":"4c91f07c-3a13-41d5-aa0a-d4d3fd452b2e","resolution":{"observed_at":"2026-08-11T21:15:45.471772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-11T21:15:45.477475Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.477475Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:44e930aac242de565533dbc0685a2c8da74dadd77838785edae4190f4a1340d4","observation_id":"538b0ddb-5dbf-4130-ab77-8f763dc35550","resolution":{"observed_at":"2026-08-11T21:15:45.477475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-13T10:59:39.237521Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-11T21:15:45.483079Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.483079Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:6d223eb22f72852bc7e4801a36047bbd3e2a0de3c92ce88a874fe9214ea069b1","observation_id":"eda6088e-7fec-415d-ba2a-21aaecb2a30b","resolution":{"observed_at":"2026-08-11T21:15:45.483079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-11T21:15:45.488218Z","title":"Aligning modalities in vision large lan- guage models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.488218Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:3be532ce5226d3c9bec26bcee3a39514b66a7b64427e5aef1e20f653ff9f1cec","observation_id":"75cd0b7e-36f6-420e-b4de-136dfbbaaccc","resolution":{"observed_at":"2026-08-11T21:15:45.488218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-13T02:44:39.936004Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-11T21:15:45.494340Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.494340Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:2052809b2c590b0d66e7d5633241fed67ef9a0e96faaa171ae96f56af0d70ca7","observation_id":"7b241dee-3bf3-494f-83bf-bdb857a076f1","resolution":{"observed_at":"2026-08-11T21:15:45.494340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T21:15:45.500631Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.500631Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:c03dc4c9b68d01f3f0597df3146f0909f7ce03e4b54d03efcf6a17388705ee3f","observation_id":"3ebe7466-a4a3-4a02-92d7-4503ba250d5b","resolution":{"observed_at":"2026-08-11T21:15:45.500631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.722914Z","title":"GPT-4o and our Critic model produce similar scores for responses, but they fail to identify the flaws in bad responses from the baseline LLA V A model","venue":null,"work_id":"d735516e-5061-475e-ac73-5162c4a177f3","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.506876Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:11e998522c7d0c782f09b25d976f0a1b2da1fe871e9320c7690bdaca9e2dce8f","observation_id":"3ade1ccc-ebd7-4f56-9f90-2287aa58bc8e","resolution":{"observed_at":"2026-08-11T21:15:46.728234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.705203Z","title":"As shown in Table 8, most of the experiment is con- ducted with prompts in rating style, apart from the ablation study presented in Section 5.3","venue":null,"work_id":"0c58b2a1-ea44-4bc0-a0d8-3b79635ede88","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.513267Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:79285a80495212b86ab39dbeec1afb63415d84cb88cc8a163820cf53f5396047","observation_id":"37566070-fac6-4220-bf83-d2c6b060ebaf","resolution":{"observed_at":"2026-08-11T21:15:46.710936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.684509Z","title":"The training details are shown in Table 2","venue":null,"work_id":"97f4d9b5-3091-4214-8c3e-ffac884c192b","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.519074Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:40329409a197fa3f5bc81c1c3e245ca316769948863ebe18d16ebc37e78db8f5","observation_id":"9973f9c9-347f-40a6-8ac0-b9fa44c59baf","resolution":{"observed_at":"2026-08-11T21:15:46.691045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.664949Z","title":"Using annotated preference data, one round of preference learning is conducted on LLaV A1.5","venue":null,"work_id":"c1e4eb95-c7da-4f7e-ac49-9e898a90b8b7","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.524962Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:f4c37f4102e2ab1671b3ca94da5fa89fa88b6b4fb2f390b98ce0e2d9f73e0c28","observation_id":"95650ce3-5617-4935-b03a-8d964506304d","resolution":{"observed_at":"2026-08-11T21:15:46.670611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.647443Z","title":null,"venue":null,"work_id":"9854c609-a146-4ea9-9bd8-d46c4ec01d5d","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.531083Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:34b7f8d5619cfc46890dc13493d1081b177e792061de4ce60bfaf97d77e2c6ae","observation_id":"e4972ee4-a8ae-4bcb-b70a-11b9cb3e5809","resolution":{"observed_at":"2026-08-11T21:15:46.652699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.631158Z","title":null,"venue":null,"work_id":"a5d4002c-1d3d-409e-81ee-2f16fb3f3580","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.537284Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:8b3a406a790b78a655dd4ffc39e78159b5e7707914922ec21f8f961a444cb729","observation_id":"9661aef2-010b-4c59-8e7b-598599019fca","resolution":{"observed_at":"2026-08-11T21:15:46.636166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.614084Z","title":"Here, we will show some examples between EACO and baseline LLaV A-v1.6- Mistral-7B in Table 9 and 10","venue":null,"work_id":"9724bae7-91fe-44d7-91cd-1bdcd40e2ba7","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.542436Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:f1ffd49bfad79944c18057264741d5487b14449c62a00d01010accd66a516f15","observation_id":"e55212cd-03c3-4adb-81a8-741fcfaca837","resolution":{"observed_at":"2026-08-11T21:15:46.619883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:15:46.595353Z","title":"score:⟨total points⟩","venue":null,"work_id":"854c2abb-fc6d-49cf-854f-74c1308a974a","year":null},"citing_paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:45.548297Z"},"links":{"citing_paper":"/paper/2412.04903"},"observation_digest":"sha256:ecd1e422500d6da18d953fac4e86778da4441187aec07723339be7d2deb41533","observation_id":"d6e4cda5-e15e-4dcd-8cd7-63f1716d6fc7","resolution":{"observed_at":"2026-08-11T21:15:46.601541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04903","last_updated":"2024-12-16T13:47:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T12:58:40.404542Z","submitted_at":"2024-12-06T09:59:47Z","title":"EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2412.04903."}