{"as_of":"2026-08-12T03:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b59bebd4bfc2870c0771e573e520d445823c607a90e646af12ef95b444846672","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:14:12.081333Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22396/citation-record","integrity":"/paper/2505.22396/integrity","json":"/paper/2505.22396/citation-record.json","paper":"/paper/2505.22396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:01.772785Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:01.772785Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e9ccfc591ce6d6057b67f9bb0bd6ba45fa4b693d2f67b4dc06b771d1016a4be3","observation_id":"7b818da2-af0c-41cb-a27e-46eefe6f5ef4","resolution":{"observed_at":"2026-08-07T13:14:01.772785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T13:14:01.890332Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:01.890332Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d6203db31df4cf9a1572b062a205fc9df0e5110e90569033d09179519a49aea1","observation_id":"4681f850-b3f1-48c3-9422-1a801a1c9c6a","resolution":{"observed_at":"2026-08-07T13:14:01.890332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:14:02.046571Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.046571Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:4bcd65b4b612047aa1ec5e68759c1b5b1386b0508be3edd721c8cf5f2bb2be38","observation_id":"bd609cff-e1f7-4966-be18-429f51a0773b","resolution":{"observed_at":"2026-08-07T13:14:02.046571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:02.195508Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.195508Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:13b1c57a989dd5ee9bed544f58c20a9402a317788f0c312b8446b747acbfd76d","observation_id":"3e8613e0-9b8f-43d8-96b5-74253538e336","resolution":{"observed_at":"2026-08-07T13:14:02.195508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.705923Z","title":"Large language models are visual reasoning coordinators.Advances in Neural Information Processing Systems, 36:70115–70140, 2023","venue":null,"work_id":"cfe345e2-7803-4497-9b83-429d25cd927e","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.734269Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:702f1fdaba4f2c7e0349df10a43b2d3b41c57d9c8a2045f12991a2f0553f064e","observation_id":"8724dce0-149c-4e87-8b19-3eecc36e8b5c","resolution":{"observed_at":"2026-08-07T13:14:15.759029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.578348Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023","venue":null,"work_id":"9bf39fc8-5602-45e2-9e97-3ae6934858db","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.831794Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:355994d8b4bcf5b3004278860483ef7153b2a7067bc747103536cb557b17e653","observation_id":"259b3ba0-7cc2-4266-a150-1781c9c856a2","resolution":{"observed_at":"2026-08-07T13:14:15.638902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.446635Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"18f48a63-2e2a-4d3a-ab34-1673166aa143","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.998390Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:59eb3c939f9f12fdf3c6357f917e0f90449515f87094644c144bdbec05b99456","observation_id":"e3e4986c-e0f0-4373-b274-7ec4587116bd","resolution":{"observed_at":"2026-08-07T13:14:15.515420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.123068Z","title":"A picture is worth more words over time: Multimodality and narrative structure across eight decades of american superhero comics","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.123068Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7f3811415b10fc739ed600bfbb5629e60c9d0e65c5cc67784b8ccadf73afb854","observation_id":"e1c8132d-48f9-4601-bea8-44d08f70b3a9","resolution":{"observed_at":"2026-08-07T13:14:03.123068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.295738Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.295738Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a403735f23f1c2a1196bb4d0478d87d6fcc38046ff2831239da4815c5054d0fa","observation_id":"ff421208-0027-4e5e-b28f-d2c64a2d2cbb","resolution":{"observed_at":"2026-08-07T13:14:03.295738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.460259Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.460259Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:66cd1f440f94b5fb972d2e60210d2d416d11a2e003b6b75cebabf907153f4410","observation_id":"a332d80a-a365-4f3e-a749-215b8e790b8a","resolution":{"observed_at":"2026-08-07T13:14:03.460259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.604035Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.604035Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2cad1059cabbd7f611ce4698e8c03f44a687048b3c6c6a5e272b4d48711731a0","observation_id":"ce34df5e-71f0-4643-8045-2ce79608ac47","resolution":{"observed_at":"2026-08-07T13:14:03.604035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.699854Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.699854Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:1491913d00c12be9787d36dcb26ffa6db6f8de4ab9ba8f9afb01a04b5a51feab","observation_id":"df3597bb-aaba-4184-ac9d-95cca3d46c49","resolution":{"observed_at":"2026-08-07T13:14:03.699854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.763745Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.763745Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:604f252352e24452b65668651cc3a3f69bf9493124661a96ff20463d8ee12245","observation_id":"fa126fad-4926-4f28-a97a-4536b5baa132","resolution":{"observed_at":"2026-08-07T13:14:03.763745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.873044Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.873044Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:33b177ae7c497efa22d274628025ee0b57c16ebb484537b94e11f29271a1a2e9","observation_id":"b799c378-5b38-4b4e-9eb6-c40805401004","resolution":{"observed_at":"2026-08-07T13:14:03.873044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.306525Z","title":"What matters when building vision-language models?Advances in Neural Information Processing Systems, 37:87874–87907, 2024","venue":null,"work_id":"ad1b738a-7d23-4c8a-9c68-8bbf5d95eb5b","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.333850Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a1a4b894b872b049cb7adca33580c385ca366171c46efd82edfd07550ed9139c","observation_id":"f0b91b71-8d4e-4799-abe8-9575339d6475","resolution":{"observed_at":"2026-08-07T13:14:15.348575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:04.438650Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.438650Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:365d4208770b85ac25c93ac21b78de4d7fa3531f3685032a7c2c61e1eab03a6f","observation_id":"97129f29-9379-4e48-ba6a-8dac1e096d3f","resolution":{"observed_at":"2026-08-07T13:14:04.438650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:04.561866Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.561866Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:78e67ad66deaff52496bfd581b3c2aa3aae47ad5c5818ecd2ce6b34e88270e43","observation_id":"a3666b32-2ee1-4a69-8e13-e4bb32e7af89","resolution":{"observed_at":"2026-08-07T13:14:04.561866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02712","last_updated":"2024-11-05T01:24:37Z","snapshot_observed_at":"2026-08-10T01:07:52.836287Z","submitted_at":"2024-11-05T01:24:37Z","title":"V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02712","snapshot_observed_at":"2026-08-07T13:14:04.742031Z","title":"V-dpo: Mitigating hallucination in large vision language models via vision-guided direct preference optimization.arXiv preprint arXiv:2411.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.742031Z"},"links":{"cited_paper":"/paper/2411.02712","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:ef57b941bc42de5b4c2065c6f15d1fb82f8514bc83df292a3299fc7392416d93","observation_id":"388e6486-af46-446a-be6e-fad635062ad9","resolution":{"observed_at":"2026-08-07T13:14:04.742031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T13:14:04.902892Z","title":"Aligning modali- ties in vision large language models via preference fine-tuning.arXiv preprint arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.902892Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:24adfecf4353dc9cce506f26d5c0d9cbed8f19662259539ec9915d6877b936ce","observation_id":"bf661a58-0dff-4630-838b-4c6efac939b1","resolution":{"observed_at":"2026-08-07T13:14:04.902892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13122","last_updated":"2025-04-17T17:39:41Z","snapshot_observed_at":"2026-08-07T16:01:21.534867Z","submitted_at":"2025-04-17T17:39:41Z","title":"VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13122","snapshot_observed_at":"2026-08-07T13:14:05.050891Z","title":"Vistadpo: Video hierarchical spatial-temporal direct preference optimiza- tion for large video models.arXiv preprint arXiv:2504.13122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.050891Z"},"links":{"cited_paper":"/paper/2504.13122","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2df40de44e1e5cedb61bc3e81404e517cc557853933909ea46559994eafe20e6","observation_id":"3051702f-4258-486d-9388-5c856b21aee1","resolution":{"observed_at":"2026-08-07T13:14:05.050891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.139303Z","title":"Automated multi-level preference for mllms.Advances in Neural Information Processing Systems, 37:26171–26194, 2024","venue":null,"work_id":"d65961c7-6c4d-4700-96f7-9dcbf9779043","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.145938Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:86140c630a39991e36823665e840f112bc3bc41336396713be6fe90080ed1979","observation_id":"8edcfc12-27b1-4b35-a11c-fe648441b0ac","resolution":{"observed_at":"2026-08-07T13:14:15.225054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.973515Z","title":"Clip-dpo: Vision- language models as a source of preference for fixing hallucinations in lvlms","venue":null,"work_id":"daf6ff67-1e1c-482c-8c2d-7157f8495523","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.274462Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c07e6a1900ac44447d19e528d6ddf784f82f4aead6eace8c1c268e5c08e98727","observation_id":"c8e1ed7f-cbba-426d-929c-74da506f8dc1","resolution":{"observed_at":"2026-08-07T13:14:15.036942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.830005Z","title":"Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models","venue":null,"work_id":"b80a4f85-d96b-4309-a411-2bcc15236ccf","year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.430310Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:6ef4b9d1ef2de493c5ba9384958ec4c3c5b8175477af41e4442b3bacdd8b482d","observation_id":"6c237cc1-6d68-483d-9468-8bfc76e9a27e","resolution":{"observed_at":"2026-08-07T13:14:14.896862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13792","last_updated":"2025-03-18T00:45:02Z","snapshot_observed_at":"2026-08-07T16:56:19.726284Z","submitted_at":"2025-03-18T00:45:02Z","title":"Identifying and Mitigating Position Bias of Multi-image Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13792","snapshot_observed_at":"2026-08-07T13:14:05.544878Z","title":"Identifying and mitigating position bias of multi-image vision-language models.arXiv preprint arXiv:2503.13792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.544878Z"},"links":{"cited_paper":"/paper/2503.13792","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:034c86472c8f8f3cc22bc7484cf9452ff66ef9706851516cfe800f386004efe1","observation_id":"62b53938-6dcd-41ba-8599-dc0b41e0c2a8","resolution":{"observed_at":"2026-08-07T13:14:05.544878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:05.712377Z","title":"Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation.arXiv preprint arXiv:2503.05255, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.712377Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:bf50d3221d99799dfbab511a4a59dc8a16ce17590b5cc60c457b6710f4351809","observation_id":"d447e63b-10d3-4cd5-9946-f778494f23d0","resolution":{"observed_at":"2026-08-07T13:14:05.712377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-07T13:14:05.941977Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference.arXiv preprint arXiv:2406.18139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.941977Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5010ec60f99f5851532f2d542621cf4a2a485a34e844e5ad0fbe7e053245bf1d","observation_id":"eaf5978a-e6b8-4f6c-928f-420226815c55","resolution":{"observed_at":"2026-08-07T13:14:05.941977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-10T13:19:53.028871Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16629","snapshot_observed_at":"2026-08-07T13:14:06.085419Z","title":"Chip: Cross-modal hierarchical direct preference optimization for multimodal llms.arXiv preprint arXiv:2501.16629, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.085419Z"},"links":{"cited_paper":"/paper/2501.16629","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:33d826b089e6ccda22c79823a62ea5ce1cb39b0abd741a0c93ff4eef6e67a126","observation_id":"bff41d04-64f7-4048-95f9-c7627027b03f","resolution":{"observed_at":"2026-08-07T13:14:06.085419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:14:06.186485Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.186485Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3fd5052a6e9a09da7f9154ff92a06dd6062901b81d89d2d7a1c7a764139c1ee2","observation_id":"5d2c0eea-c039-43a9-b406-d66cf12808d7","resolution":{"observed_at":"2026-08-07T13:14:06.186485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:14:06.400552Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.400552Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:9e9774b5f7bca5e70e8ee27a34b78389f20928c219ca98cbc6bf307cf7c4469e","observation_id":"480ea5e2-4e8a-46a0-ab25-c312b9d6454d","resolution":{"observed_at":"2026-08-07T13:14:06.400552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-07T13:14:06.523108Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms.arXiv preprint arXiv:2406.11833, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.523108Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:296a90a2846b411fc35046d50d27b0ba5fee6ab347e424e12025807566a5f341","observation_id":"09821de1-a06d-4d42-8d64-0d39800c32f7","resolution":{"observed_at":"2026-08-07T13:14:06.523108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-10T08:25:28.506770Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T13:14:06.644471Z","title":"Object hallucination in image captioning.arXiv preprint arXiv:1809.02156, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.644471Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:205c660cccb9a302ae4b5359aee57332e0ad3d08bc9f7fd20f0235572d554212","observation_id":"68bddef1-6493-4d32-ac6b-06f362748d74","resolution":{"observed_at":"2026-08-07T13:14:06.644471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.691254Z","title":"An llm-free multi-dimensional benchmark for mllms hallucination evaluation.CoRR, 2023","venue":null,"work_id":"6eff497b-9827-4f8d-9db1-d935937656c8","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.831783Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e6ae78dfd7fb87d712345890cfb6679a44495888fe922a40f72388e5e110215f","observation_id":"a2356e2c-5cbb-45a9-b70d-feee81cdb29b","resolution":{"observed_at":"2026-08-07T13:14:14.756992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:06.936445Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.936445Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7e7d02608362f6a676a4c394b52d99e33224fa925e1fc36a24f0ded48820dd0c","observation_id":"cab32f1f-6284-4759-8859-1976660bfe7f","resolution":{"observed_at":"2026-08-07T13:14:06.936445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T13:14:07.103871Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.103871Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7214ed82209dc7e323d6268cbce054601880dfec00e6723e2e6b6d98a791ba4f","observation_id":"a399f091-c1ef-4c0a-8ac0-b13368daeaf3","resolution":{"observed_at":"2026-08-07T13:14:07.103871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.487632Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advances in Neural Information Processing Systems, 36:71683–71702, 2023","venue":null,"work_id":"ef979377-3cf6-4362-938b-162a438325c6","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.316739Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a43291b8e9c4ce61b516d927bdaa33604312e0e498ca3f2277bfe468d339ccc1","observation_id":"4cba0258-0ee1-4899-8e28-1092ddcecfaa","resolution":{"observed_at":"2026-08-07T13:14:14.610044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.236320Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text.Advances in Neural Information Processing Systems, 36:8958–8974, 2023","venue":null,"work_id":"c998e699-f797-4bdd-b10d-f7663905d91e","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.461701Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:dc17265ad6a4dd5efa4d845498c7595ac858322b570506bf4338890ec3981680","observation_id":"ef610710-4787-46de-b778-5ad01d6fe3ae","resolution":{"observed_at":"2026-08-07T13:14:14.317151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-07T13:14:07.608877Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding.arXiv preprint arXiv:2406.09411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.608877Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:902497a0388a08152c904c21a0ea7a143f761f664b21de7fe790d946bcc7ea2c","observation_id":"d2d47731-ee9a-4505-84c2-338c64a80cf7","resolution":{"observed_at":"2026-08-07T13:14:07.608877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:07.799230Z","title":"Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.799230Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:26e33101f5aad7d2aa2dc20a61d6c96ff6c86f86e546a8a3b4164f92233394b7","observation_id":"a16dd9f2-e92c-46b7-852d-d7a3b0afb6db","resolution":{"observed_at":"2026-08-07T13:14:07.799230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-11T19:41:42.384717Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T13:14:07.931473Z","title":"Mantis: Interleaved multi-image instruction tuning.arXiv preprint arXiv:2405.01483, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.931473Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:0cd949258ca4ae83e5f96a4de531ed4d33390c968025385acc96ea17136ff20b","observation_id":"e86d8e92-c36b-4122-b80d-2c7f3e74c71c","resolution":{"observed_at":"2026-08-07T13:14:07.931473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18021","last_updated":"2024-12-07T15:34:23Z","snapshot_observed_at":"2026-08-10T02:15:13.522724Z","submitted_at":"2023-11-29T19:08:11Z","title":"Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18021","snapshot_observed_at":"2026-08-07T13:14:08.070786Z","title":"Understanding and improving in-context learning on vision-language models.arXiv preprint arXiv:2311.18021, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.070786Z"},"links":{"cited_paper":"/paper/2311.18021","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:1c201a34f1b60a31b0348d256b1bb4ca846f3961fdf135dbf9f1b7c11b1e9f30","observation_id":"805c69e3-cfec-4ccb-b641-a27539f7c170","resolution":{"observed_at":"2026-08-07T13:14:08.070786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-07T13:14:08.139191Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.139191Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:6bd5a8f3e4bbc67cebb1dae7240ed247d20302d44349ae4960aa7f7214dcd93a","observation_id":"63f74f35-6add-47b5-b9d8-b895e81a7aae","resolution":{"observed_at":"2026-08-07T13:14:08.139191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.188089Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.188089Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e0eb58d3aefc0c96bab0f8b35d2d1653f715d98f304365b85102dd622b7d810f","observation_id":"a306a584-cf22-4bf0-b358-9a50034d590d","resolution":{"observed_at":"2026-08-07T13:14:08.188089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.265252Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.265252Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5da19fc647ffd56995e2e1f088d4fe830c106179a852963f864fb5a3a48f6977","observation_id":"3de70882-a362-4d61-9004-7cf1590ea603","resolution":{"observed_at":"2026-08-07T13:14:08.265252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13928","last_updated":"2025-06-02T18:36:08Z","snapshot_observed_at":"2026-08-10T23:54:20.299719Z","submitted_at":"2025-02-19T18:05:42Z","title":"Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13928","snapshot_observed_at":"2026-08-07T13:14:08.332101Z","title":"Symmetrical visual contrastive optimization: Aligning vision-language models with minimal contrastive images.arXiv preprint arXiv:2502.13928, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.332101Z"},"links":{"cited_paper":"/paper/2502.13928","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e6d031f48a0efec153e2776c8886525190a1217d3b5edf1207f2268fb9fd9bc7","observation_id":"d2a71af7-c1c0-4096-93c8-44a39d3817f5","resolution":{"observed_at":"2026-08-07T13:14:08.332101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T13:14:08.402109Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.402109Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c9b6b839452339dbe02d3dc0f48488d9c8bdcdfd41b08f467dfc0b211e2ea39e","observation_id":"77ad86f5-4f7c-4355-a3b9-7b03f5f1a8b2","resolution":{"observed_at":"2026-08-07T13:14:08.402109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-10T20:27:34.844428Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T13:14:08.456890Z","title":"Tarsier2: Advanc- ing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.456890Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:f17a73f8b925d79a07a082754ebdb747457d13576cec3c0995fa9a9a7851e728","observation_id":"a745cefa-6f64-4205-8f2c-d09036d15a8b","resolution":{"observed_at":"2026-08-07T13:14:08.456890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15334","last_updated":"2025-06-06T02:50:17Z","snapshot_observed_at":"2026-07-06T19:36:36.994783Z","submitted_at":"2024-10-20T08:56:52Z","title":"Modality-Fair Preference Optimization for Trustworthy MLLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15334","snapshot_observed_at":"2026-08-07T13:14:08.503129Z","title":"Modality-fair preference optimization for trustworthy mllm alignment.arXiv preprint arXiv:2410.15334, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.503129Z"},"links":{"cited_paper":"/paper/2410.15334","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:56512bc1d513ef71a44dc57bfddac4fb299bbcf067f792657bedf3f57e3ec1f5","observation_id":"735e8ae9-cdd5-4ebb-b5dd-e497d50ca0fb","resolution":{"observed_at":"2026-08-07T13:14:08.503129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T13:14:08.553085Z","title":"Direct preference optimization of video large multimodal models from language model reward.arXiv preprint arXiv:2404.01258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.553085Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:959c6aa6f94a0f99c36f3c4612e8183e6a337742cd98c1b5d706453a9b641cea","observation_id":"886de767-1a9b-4a88-a4aa-ddba8880c449","resolution":{"observed_at":"2026-08-07T13:14:08.553085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14148","last_updated":"2025-04-21T04:04:53Z","snapshot_observed_at":"2026-08-09T06:03:53.936554Z","submitted_at":"2024-10-18T03:34:32Z","title":"Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14148","snapshot_observed_at":"2026-08-07T13:14:08.642768Z","title":"Fine-grained verifiers: Preference modeling as next-token prediction in vision-language alignment.arXiv preprint arXiv:2410.14148, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.642768Z"},"links":{"cited_paper":"/paper/2410.14148","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:249b440ca7f662d4b0c4a8248cd83f7867f2a2c903b1e84f719ebae66d6cc5df","observation_id":"c272722a-afdf-4f57-af19-96d51716b24b","resolution":{"observed_at":"2026-08-07T13:14:08.642768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.728565Z","title":"Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation.arXiv preprint arXiv:2412.14487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.728565Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d9df85562de2d3c9d3497ef46eb0a046fc46b43f426efa07d2ea30331a11630f","observation_id":"4945f9f4-5c80-4549-9f52-122edc462dd1","resolution":{"observed_at":"2026-08-07T13:14:08.728565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.957705Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting","venue":null,"work_id":"90ea0977-e1f8-440e-829d-96f1da535c32","year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.809984Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3f649f5d854c8c28317e43c6c9deb8b8aadeb3e134cd991bc1a97bf051ccbde8","observation_id":"7c1bdc5a-5958-4900-8a8f-c98ce52e6ba1","resolution":{"observed_at":"2026-08-07T13:14:14.075232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.889619Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.889619Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7d4e6ccf55899e0b7d57d7eacf98736e83dc2f38a39d408084310052642acdc2","observation_id":"9969215a-f65e-4db6-8f39-79e1564c36e4","resolution":{"observed_at":"2026-08-07T13:14:08.889619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T13:14:08.943710Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.943710Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7ce23b2ee0047756712135f6d9541823463d55417ec31effe31471d0a6a978f5","observation_id":"80bd1e6a-bf70-4d48-8362-865b2c333fc3","resolution":{"observed_at":"2026-08-07T13:14:08.943710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.004189Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.004189Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3624af5d0cefb7d7e5408be5e3cbc1302b8de9b314fe0d29511938257e854d81","observation_id":"529df681-86c1-47e9-8f35-b8eecb7625ea","resolution":{"observed_at":"2026-08-07T13:14:09.004189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.622956Z","title":"Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024","venue":null,"work_id":"ec4d33ed-0608-4cea-856d-2a20ace4e481","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.053089Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:bf15ce5762aa3f8e1bedfda13aee095f154e6d5d2c79b3abc37f820de772243b","observation_id":"2b37f00b-4c98-4816-a4b5-23cac238d526","resolution":{"observed_at":"2026-08-07T13:14:13.777666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.393214Z","title":"Controlmllm: Training-free visual prompt learning for multimodal large language models.Advances in Neural Information Processing Systems, 37:45206–45234, 2024","venue":null,"work_id":"a7de460b-a8ae-4415-9998-3141bda6dd67","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.127164Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2cb5ca56eba31b154afabadf4a5b552351513e292c98ecafc8bd8c28cc80642b","observation_id":"676278fa-89e0-45e1-b6d6-7d401f2740c5","resolution":{"observed_at":"2026-08-07T13:14:13.485291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.210870Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.210870Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e17dd14c32aa238719e40cc64fdd80e6d4f17ade94d98fc67741f0c224554868","observation_id":"292ce210-3741-4dda-914c-6c06f64f733c","resolution":{"observed_at":"2026-08-07T13:14:09.210870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-09T18:37:19.036481Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-07T13:14:09.279344Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want.arXiv preprint arXiv:2403.20271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.279344Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e469c0bd86ee03f0d5f66eb4e854f910484394c3b46276a67dda3bb1f77172c3","observation_id":"8038ddba-2872-40b6-9f42-843263afc2fe","resolution":{"observed_at":"2026-08-07T13:14:09.279344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.341142Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.341142Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e537b1184b818b394f2276e1d7f774ab68a0736383ad9c7d8889a8533d10c9d8","observation_id":"5911b287-ce2b-415d-80df-111655e77fde","resolution":{"observed_at":"2026-08-07T13:14:09.341142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:14:09.473336Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.473336Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2f2338dfacf925326b7c2aa58a378294cbeb8b831bd9cf328d09b05f249c6c39","observation_id":"616cbabc-ee87-4b4a-81fc-493b07965263","resolution":{"observed_at":"2026-08-07T13:14:09.473336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T13:14:09.565939Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models.arXiv preprint arXiv:2408.04840, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.565939Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2dde39837f7cf424348b1372a9cd276946b1d1ff882824ee1447789bbedd849b","observation_id":"d237af20-3268-40ac-9ecb-2bed4a49397d","resolution":{"observed_at":"2026-08-07T13:14:09.565939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.624040Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.624040Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:6b35e85c9b72369c74e71beba651e5e67e5fd176ca9c4f8ec9a44c1a953bc092","observation_id":"9f266e29-492b-445e-843a-e74ab1d4d1ef","resolution":{"observed_at":"2026-08-07T13:14:09.624040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12742","last_updated":"2024-06-18T16:02:18Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:02:18Z","title":"Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12742","snapshot_observed_at":"2026-08-07T13:14:09.693716Z","title":"Benchmarking multi-image understanding in vision and language models: Perception, knowledge, reasoning, and multi-hop reasoning.arXiv preprint arXiv:2406.12742, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.693716Z"},"links":{"cited_paper":"/paper/2406.12742","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:f21e0594811f8288c46a1ce7f565945ec39aacdd0d6d92cb20b529bdb04118f3","observation_id":"c998bba7-4b75-4325-9045-4da573f3b1b5","resolution":{"observed_at":"2026-08-07T13:14:09.693716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.153364Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"865a0e28-7827-429a-be1e-1abf3d35fa8f","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.751122Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5a1fc6ee03b278b5cbd35f2435ce5e47ee3bf563e4c513d613aba64aac3e02e7","observation_id":"0790cc7a-18a6-45b9-8159-75734a52a955","resolution":{"observed_at":"2026-08-07T13:14:13.271348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-01T22:56:26.162617Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-07T13:14:09.813086Z","title":"A corpus for reasoning about natural language grounded in photographs.arXiv preprint arXiv:1811.00491, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.813086Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:9f70f2eb8bcd49c7cae8dfa2106044d60ddefa6a7e2ad8b937984d960ded63c6","observation_id":"57157a73-db4f-4cc2-9dca-3a313eb825e2","resolution":{"observed_at":"2026-08-07T13:14:09.813086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.862080Z","title":"Q-bench: A benchmark for multi-modal foundation models on low-level vision from single images to pairs.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.862080Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:b10f6fe7cdc5459772181d5e116a79a0bd9b4be7fe8bcd5f6679e6f9a43e50d2","observation_id":"321334bc-28a5-40ba-b375-c0a6b8148420","resolution":{"observed_at":"2026-08-07T13:14:09.862080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15272","last_updated":"2024-10-08T07:18:21Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T21:22:58Z","title":"MIBench: Evaluating Multimodal Large Language Models over Multiple Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15272","snapshot_observed_at":"2026-08-07T13:14:09.946184Z","title":"Mibench: Evaluating multimodal large language models over multiple images.arXiv preprint arXiv:2407.15272, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.946184Z"},"links":{"cited_paper":"/paper/2407.15272","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:0f251da7f7621e523522438b537d0e3ad8ee2d227b6712e9b24b30cc4d114ed7","observation_id":"d1f390e2-0e1d-4697-a7f6-530f2d2faf57","resolution":{"observed_at":"2026-08-07T13:14:09.946184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.032271Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.032271Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7d2cd5a920520506fdfc31615fb27113387d77ecbf490f24f4477f1ef3990c3d","observation_id":"d568806a-1dfe-431a-b577-79d6cb16f583","resolution":{"observed_at":"2026-08-07T13:14:10.032271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T13:14:10.120910Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.120910Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:751ba186fbb72a3b550e59b647c04fe4179f845d0e81b6bfc111b2146d0d51f0","observation_id":"fecade87-d7f8-4e4c-a397-1b88685273b1","resolution":{"observed_at":"2026-08-07T13:14:10.120910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.166520Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.166520Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:0b1efdba22ad70a3904a3ef29e62857e79cae6fc44205b8ebb0cee86456a13a7","observation_id":"4337c286-c758-4461-bdc4-3fc61a4fedd4","resolution":{"observed_at":"2026-08-07T13:14:10.166520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.210781Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.210781Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:84d18badf3d62cb42cacdd815da4a65125d16f1d8e7b1bc5b283a016d200806e","observation_id":"69a6f517-05d2-495e-b990-2a2aa6d00c11","resolution":{"observed_at":"2026-08-07T13:14:10.210781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T13:14:10.325407Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.325407Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7b9cda1f7608dbe5cb7ddab25d5c27f5369dc6d4b44f6573e731ec6b422adf92","observation_id":"90226fa6-d728-4162-9925-18901c45d399","resolution":{"observed_at":"2026-08-07T13:14:10.325407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.401578Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.401578Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3b7b9f31a5c8d198e8f4bf92ff5d5d5e1dcf868d0bda2fd22f9744e6de907a61","observation_id":"022bb662-11ca-462c-9b9d-8e54356f7a2a","resolution":{"observed_at":"2026-08-07T13:14:10.401578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.473287Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.473287Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c97688a76505ef5dcc2389e413df464b1d95de43bbafcaf5aff95d017f1b3300","observation_id":"18319a3c-d290-4fcf-8920-7038aa4346d7","resolution":{"observed_at":"2026-08-07T13:14:10.473287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:14:10.545631Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.545631Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a36cdfc34877ec20e4bc3a68bbdcd6749aee2ae47840417e472a0153049bf9c8","observation_id":"0bc9fb29-dc0c-40fb-8b1a-65b6daccebc2","resolution":{"observed_at":"2026-08-07T13:14:10.545631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.674992Z","title":"Needle in a multimodal haystack.Advances in Neural Information Processing Systems, 37:20540–20565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.674992Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2c40a34041b1e39c8f7f993d4123fd65aec909535ded6d5eab470cc51b2653a2","observation_id":"3ce90a9c-56f3-45b9-b71d-3fc4a5572dd5","resolution":{"observed_at":"2026-08-07T13:14:10.674992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:14:10.915411Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.915411Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3bbd63d2f6c1cf6fb623f507f8bdb510374cd7e3b4deb74084bcafbb80a721b3","observation_id":"7661d267-206a-4624-a7d2-ad635d018b9d","resolution":{"observed_at":"2026-08-07T13:14:10.915411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:14:11.487884Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.487884Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e4d095fb6bf63f36c807ec36f2e0c202896d09f61c90ff88c749499e90dcbd06","observation_id":"de1b94e6-fcd7-4656-8ffb-d5da17e00351","resolution":{"observed_at":"2026-08-07T13:14:11.487884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T13:14:11.764663Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.764663Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:f1a856cd0ea60d111fa50ac86bfd3a20a12a95d43e9e7f98be37fe1ae46ada08","observation_id":"46af83b8-7631-4679-8f6f-34e9a00903f0","resolution":{"observed_at":"2026-08-07T13:14:11.764663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:11.846564Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.846564Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2b6c5b3ddd97c44131331b878a348e799d0a18f67d44f754a923247a4d78bec2","observation_id":"a367d560-e83e-4c1a-9c08-9bb5995e9579","resolution":{"observed_at":"2026-08-07T13:14:11.846564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13254","last_updated":"2024-06-12T17:59:55Z","snapshot_observed_at":"2026-08-10T13:36:32.507702Z","submitted_at":"2024-02-20T18:59:55Z","title":"CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13254","snapshot_observed_at":"2026-08-07T13:14:11.965719Z","title":"Countercurate: Enhancing physical and semantic visio-linguistic compositional reasoning via counterfactual examples.arXiv preprint arXiv:2402.13254, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.965719Z"},"links":{"cited_paper":"/paper/2402.13254","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2135b9c8fa246a9d9098d944afa4ed8303687c212b09c9f4fdc942cb7942ba45","observation_id":"f7c6305a-5c86-46a5-8d21-618a957ff359","resolution":{"observed_at":"2026-08-07T13:14:11.965719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14750","last_updated":"2025-01-11T15:12:37Z","snapshot_observed_at":"2026-07-06T19:20:14.980387Z","submitted_at":"2024-09-23T06:56:51Z","title":"FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14750","snapshot_observed_at":"2026-08-07T13:14:12.081333Z","title":"Describe the following images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:12.081333Z"},"links":{"cited_paper":"/paper/2409.14750","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:ebae734bb7a801060fc9d386a136971a2ca3f43cc23827177b81835ab276e280","observation_id":"f3831c0b-52d7-46a1-a6cc-16ab5a63680d","resolution":{"observed_at":"2026-08-07T13:14:12.081333Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2505.22396."}