Pith. sign in

Paper Citation Record · LEDGER

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs

As of 11 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2505.22396.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.22396 v1

Coverage vector

measured 82 of 82 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:14:12.081333Z

measured 82 of 82 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

82 of 82 outbound references displayed

  • verified exact0
  • verified fuzzy14
  • unresolved67
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7b818da2-af0c-41cb-a27e-46eefe6f5ef4 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:01.772785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:01.772785Z digest=sha256:e9ccfc591ce6d6057b67f9bb0bd6ba45fa4b693d2f67b4dc06b771d1016a4be3

Observation 4681f850-b3f1-48c3-9422-1a801a1c9c6a · outbound

This paper cites Seed1.5-VL Technical Report.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Seed1.5-VL Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:01.890332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:01.890332Z digest=sha256:d6203db31df4cf9a1572b062a205fc9df0e5110e90569033d09179519a49aea1

Observation bd609cff-e1f7-4966-be18-429f51a0773b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:02.046571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:02.046571Z digest=sha256:4bcd65b4b612047aa1ec5e68759c1b5b1386b0508be3edd721c8cf5f2bb2be38

Observation 3e8613e0-9b8f-43d8-96b5-74253538e336 · outbound

This paper cites Vqa: Visual question answering.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Vqa: Visual question answering

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:02.195508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:02.195508Z digest=sha256:13b1c57a989dd5ee9bed544f58c20a9402a317788f0c312b8446b747acbfd76d

Observation 8724dce0-149c-4e87-8b19-3eecc36e8b5c · outbound

This paper cites Large language models are visual reasoning coordinators.Advances in Neural Information Processing Systems, 36:70115–70140, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Large language models are visual reasoning coordinators.Advances in Neural Information Processing Systems, 36:70115–70140, 2023

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.759029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:02.734269Z digest=sha256:702f1fdaba4f2c7e0349df10a43b2d3b41c57d9c8a2045f12991a2f0553f064e

Observation 259b3ba0-7cc2-4266-a150-1781c9c856a2 · outbound

This paper cites Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.638902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:02.831794Z digest=sha256:355994d8b4bcf5b3004278860483ef7153b2a7067bc747103536cb557b17e653

Observation e3e4986c-e0f0-4373-b274-7ec4587116bd · outbound

This paper cites Vipergpt: Visual inference via python execution for reasoning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Vipergpt: Visual inference via python execution for reasoning

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.515420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:02.998390Z digest=sha256:59eb3c939f9f12fdf3c6357f917e0f90449515f87094644c144bdbec05b99456

Observation e1c8132d-48f9-4601-bea8-44d08f70b3a9 · outbound

This paper cites A picture is worth more words over time: Multimodality and narrative structure across eight decades of american superhero comics.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs A picture is worth more words over time: Multimodality and narrative structure across eight decades of american superhero comics

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.123068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.123068Z digest=sha256:7f3811415b10fc739ed600bfbb5629e60c9d0e65c5cc67784b8ccadf73afb854

Observation ff421208-0027-4e5e-b28f-d2c64a2d2cbb · outbound

This paper cites Seed-bench: Benchmarking multimodal large language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Seed-bench: Benchmarking multimodal large language models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.295738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.295738Z digest=sha256:a403735f23f1c2a1196bb4d0478d87d6fcc38046ff2831239da4815c5054d0fa

Observation a332d80a-a365-4f3e-a749-215b8e790b8a · outbound

This paper cites Improved baselines with visual instruction tuning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Improved baselines with visual instruction tuning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.460259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.460259Z digest=sha256:66cd1f440f94b5fb972d2e60210d2d416d11a2e003b6b75cebabf907153f4410

Observation ce34df5e-71f0-4643-8045-2ce79608ac47 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.604035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.604035Z digest=sha256:2cad1059cabbd7f611ce4698e8c03f44a687048b3c6c6a5e272b4d48711731a0

Observation df3597bb-aaba-4184-ac9d-95cca3d46c49 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.699854Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.699854Z digest=sha256:1491913d00c12be9787d36dcb26ffa6db6f8de4ab9ba8f9afb01a04b5a51feab

Observation fa126fad-4926-4f28-a97a-4536b5baa132 · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answering.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Making the v in vqa matter: Elevating the role of image understanding in visual question answering

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.763745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.763745Z digest=sha256:604f252352e24452b65668651cc3a3f69bf9493124661a96ff20463d8ee12245

Observation b799c378-5b38-4b4e-9eb6-c40805401004 · outbound

This paper cites Ok-vqa: A visual question answering benchmark requiring external knowledge.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Ok-vqa: A visual question answering benchmark requiring external knowledge

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.873044Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.873044Z digest=sha256:33b177ae7c497efa22d274628025ee0b57c16ebb484537b94e11f29271a1a2e9

Observation f0b91b71-8d4e-4799-abe8-9575339d6475 · outbound

This paper cites What matters when building vision-language models?Advances in Neural Information Processing Systems, 37:87874–87907, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs What matters when building vision-language models?Advances in Neural Information Processing Systems, 37:87874–87907, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.348575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:04.333850Z digest=sha256:a1a4b894b872b049cb7adca33580c385ca366171c46efd82edfd07550ed9139c

Observation 97129f29-9379-4e48-ba6a-8dac1e096d3f · outbound

This paper cites Generative multimodal models are in-context learners.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Generative multimodal models are in-context learners

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.438650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.438650Z digest=sha256:365d4208770b85ac25c93ac21b78de4d7fa3531f3685032a7c2c61e1eab03a6f

Observation a3666b32-2ee1-4a69-8e13-e4bb32e7af89 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Direct preference optimization: Your language model is secretly a reward model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.561866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.561866Z digest=sha256:78e67ad66deaff52496bfd581b3c2aa3aae47ad5c5818ecd2ce6b34e88270e43

Observation 388e6486-af46-446a-be6e-fad635062ad9 · outbound

This paper cites V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.742031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.742031Z digest=sha256:ef57b941bc42de5b4c2065c6f15d1fb82f8514bc83df292a3299fc7392416d93

Observation bf661a58-0dff-4630-838b-4c6efac939b1 · outbound

This paper cites Aligning Modalities in Vision Large Language Models via Preference Fine-tuning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.902892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.902892Z digest=sha256:24adfecf4353dc9cce506f26d5c0d9cbed8f19662259539ec9915d6877b936ce

Observation 3051702f-4258-486d-9388-5c856b21aee1 · outbound

This paper cites VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.050891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.050891Z digest=sha256:2df40de44e1e5cedb61bc3e81404e517cc557853933909ea46559994eafe20e6

Observation 8edcfc12-27b1-4b35-a11c-fe648441b0ac · outbound

This paper cites Automated multi-level preference for mllms.Advances in Neural Information Processing Systems, 37:26171–26194, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Automated multi-level preference for mllms.Advances in Neural Information Processing Systems, 37:26171–26194, 2024

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.225054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:05.145938Z digest=sha256:86140c630a39991e36823665e840f112bc3bc41336396713be6fe90080ed1979

Observation c8e1ed7f-cbba-426d-929c-74da506f8dc1 · outbound

This paper cites Clip-dpo: Vision- language models as a source of preference for fixing hallucinations in lvlms.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Clip-dpo: Vision- language models as a source of preference for fixing hallucinations in lvlms

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.036942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:05.274462Z digest=sha256:c07e6a1900ac44447d19e528d6ddf784f82f4aead6eace8c1c268e5c08e98727

Observation 6c237cc1-6d68-483d-9468-8bfc76e9a27e · outbound

This paper cites Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.896862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:05.430310Z digest=sha256:6ef4b9d1ef2de493c5ba9384958ec4c3c5b8175477af41e4442b3bacdd8b482d

Observation 62b53938-6dcd-41ba-8599-dc0b41e0c2a8 · outbound

This paper cites Identifying and Mitigating Position Bias of Multi-image Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Identifying and Mitigating Position Bias of Multi-image Vision-Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.544878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.544878Z digest=sha256:034c86472c8f8f3cc22bc7484cf9452ff66ef9706851516cfe800f386004efe1

Observation d447e63b-10d3-4cd5-9946-f778494f23d0 · outbound

This paper cites Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation.arXiv preprint arXiv:2503.05255, 2025.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation.arXiv preprint arXiv:2503.05255, 2025

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.712377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.712377Z digest=sha256:bf50d3221d99799dfbab511a4a59dc8a16ce17590b5cc60c457b6710f4351809

Observation eaf5978a-e6b8-4f6c-928f-420226815c55 · outbound

This paper cites LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.941977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.941977Z digest=sha256:5010ec60f99f5851532f2d542621cf4a2a485a34e844e5ad0fbe7e053245bf1d

Observation bff41d04-64f7-4048-95f9-c7627027b03f · outbound

This paper cites CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.085419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.085419Z digest=sha256:33d826b089e6ccda22c79823a62ea5ce1cb39b0abd741a0c93ff4eef6e67a126

Observation 5d2c0eea-c039-43a9-b406-d66cf12808d7 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs LLaVA-OneVision: Easy Visual Task Transfer

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.186485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.186485Z digest=sha256:3fd5052a6e9a09da7f9154ff92a06dd6062901b81d89d2d7a1c7a764139c1ee2

Observation 480ea5e2-4e8a-46a0-ab25-c312b9d6454d · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.400552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.400552Z digest=sha256:9e9774b5f7bca5e70e8ee27a34b78389f20928c219ca98cbc6bf307cf7c4469e

Observation 09821de1-a06d-4d42-8d64-0d39800c32f7 · outbound

This paper cites MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.523108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.523108Z digest=sha256:296a90a2846b411fc35046d50d27b0ba5fee6ab347e424e12025807566a5f341

Observation 68bddef1-6493-4d32-ac6b-06f362748d74 · outbound

This paper cites Object Hallucination in Image Captioning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Object Hallucination in Image Captioning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.644471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.644471Z digest=sha256:205c660cccb9a302ae4b5359aee57332e0ad3d08bc9f7fd20f0235572d554212

Observation a2356e2c-5cbb-45a9-b70d-feee81cdb29b · outbound

This paper cites An llm-free multi-dimensional benchmark for mllms hallucination evaluation.CoRR, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs An llm-free multi-dimensional benchmark for mllms hallucination evaluation.CoRR, 2023

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.756992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:06.831783Z digest=sha256:e6ae78dfd7fb87d712345890cfb6679a44495888fe922a40f72388e5e110215f

Observation cab32f1f-6284-4759-8859-1976660bfe7f · outbound

This paper cites Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.936445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.936445Z digest=sha256:7e7d02608362f6a676a4c394b52d99e33224fa925e1fc36a24f0ded48820dd0c

Observation a399f091-c1ef-4c0a-8ac0-b13368daeaf3 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.103871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.103871Z digest=sha256:7214ed82209dc7e323d6268cbce054601880dfec00e6723e2e6b6d98a791ba4f

Observation 4cba0258-0ee1-4899-8e28-1092ddcecfaa · outbound

This paper cites Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advances in Neural Information Processing Systems, 36:71683–71702, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advances in Neural Information Processing Systems, 36:71683–71702, 2023

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.610044Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:07.316739Z digest=sha256:a43291b8e9c4ce61b516d927bdaa33604312e0e498ca3f2277bfe468d339ccc1

Observation ef610710-4787-46de-b778-5ad01d6fe3ae · outbound

This paper cites Multimodal c4: An open, billion-scale corpus of images interleaved with text.Advances in Neural Information Processing Systems, 36:8958–8974, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Multimodal c4: An open, billion-scale corpus of images interleaved with text.Advances in Neural Information Processing Systems, 36:8958–8974, 2023

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.317151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:07.461701Z digest=sha256:dc17265ad6a4dd5efa4d845498c7595ac858322b570506bf4338890ec3981680

Observation d2d47731-ee9a-4505-84c2-338c64a80cf7 · outbound

This paper cites MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.608877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.608877Z digest=sha256:902497a0388a08152c904c21a0ea7a143f761f664b21de7fe790d946bcc7ea2c

Observation a16dd9f2-e92c-46b7-852d-d7a3b0afb6db · outbound

This paper cites Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.799230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.799230Z digest=sha256:26e33101f5aad7d2aa2dc20a61d6c96ff6c86f86e546a8a3b4164f92233394b7

Observation e86d8e92-c36b-4122-b80d-2c7f3e74c71c · outbound

This paper cites MANTIS: Interleaved Multi-Image Instruction Tuning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MANTIS: Interleaved Multi-Image Instruction Tuning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.931473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.931473Z digest=sha256:283aad0701477c64fdad24a4b697c6a63085de50c4f54844795fbb4a77c318bb

Observation 805c69e3-cfec-4ccb-b641-a27539f7c170 · outbound

This paper cites Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.070786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.070786Z digest=sha256:1c201a34f1b60a31b0348d256b1bb4ca846f3961fdf135dbf9f1b7c11b1e9f30

Observation 63f74f35-6add-47b5-b9d8-b895e81a7aae · outbound

This paper cites MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.139191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.139191Z digest=sha256:6bd5a8f3e4bbc67cebb1dae7240ed247d20302d44349ae4960aa7f7214dcd93a

Observation a306a584-cf22-4bf0-b358-9a50034d590d · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.188089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.188089Z digest=sha256:e0eb58d3aefc0c96bab0f8b35d2d1653f715d98f304365b85102dd622b7d810f

Observation 3de70882-a362-4d61-9004-7cf1590ea603 · outbound

This paper cites Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.265252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.265252Z digest=sha256:5da19fc647ffd56995e2e1f088d4fe830c106179a852963f864fb5a3a48f6977

Observation d2a71af7-c1c0-4096-93c8-44a39d3817f5 · outbound

This paper cites Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.332101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.332101Z digest=sha256:e6d031f48a0efec153e2776c8886525190a1217d3b5edf1207f2268fb9fd9bc7

Observation 77ad86f5-4f7c-4355-a3b9-7b03f5f1a8b2 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.402109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.402109Z digest=sha256:c9b6b839452339dbe02d3dc0f48488d9c8bdcdfd41b08f467dfc0b211e2ea39e

Observation a745cefa-6f64-4205-8f2c-d09036d15a8b · outbound

This paper cites Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.456890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.456890Z digest=sha256:f17a73f8b925d79a07a082754ebdb747457d13576cec3c0995fa9a9a7851e728

Observation 735e8ae9-cdd5-4ebb-b5dd-e497d50ca0fb · outbound

This paper cites Modality-Fair Preference Optimization for Trustworthy MLLM Alignment.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Modality-Fair Preference Optimization for Trustworthy MLLM Alignment

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.503129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.503129Z digest=sha256:56512bc1d513ef71a44dc57bfddac4fb299bbcf067f792657bedf3f57e3ec1f5

Observation 886de767-1a9b-4a88-a4aa-ddba8880c449 · outbound

This paper cites Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.553085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.553085Z digest=sha256:959c6aa6f94a0f99c36f3c4612e8183e6a337742cd98c1b5d706453a9b641cea

Observation c272722a-afdf-4f57-af19-96d51716b24b · outbound

This paper cites Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.642768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.642768Z digest=sha256:249b440ca7f662d4b0c4a8248cd83f7867f2a2c903b1e84f719ebae66d6cc5df

Observation 4945f9f4-5c80-4549-9f52-122edc462dd1 · outbound

This paper cites Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation.arXiv preprint arXiv:2412.14487, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation.arXiv preprint arXiv:2412.14487, 2024

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.728565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.728565Z digest=sha256:d9df85562de2d3c9d3497ef46eb0a046fc46b43f426efa07d2ea30331a11630f

Observation 7c1bdc5a-5958-4900-8a8f-c98ce52e6ba1 · outbound

This paper cites Denseclip: Language-guided dense prediction with context-aware prompting.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Denseclip: Language-guided dense prediction with context-aware prompting

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.075232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:08.809984Z digest=sha256:3f649f5d854c8c28317e43c6c9deb8b8aadeb3e134cd991bc1a97bf051ccbde8

Observation 9969215a-f65e-4db6-8f39-79e1564c36e4 · outbound

This paper cites Segment anything.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Segment anything

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.889619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.889619Z digest=sha256:7d4e6ccf55899e0b7d57d7eacf98736e83dc2f38a39d408084310052642acdc2

Observation 80bd1e6a-bf70-4d48-8362-865b2c333fc3 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs SAM 2: Segment Anything in Images and Videos

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.943710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.943710Z digest=sha256:7ce23b2ee0047756712135f6d9541823463d55417ec31effe31471d0a6a978f5

Observation 529df681-86c1-47e9-8f35-b8eecb7625ea · outbound

This paper cites What does clip know about a red circle? visual prompt engineering for vlms.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs What does clip know about a red circle? visual prompt engineering for vlms

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.004189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.004189Z digest=sha256:3624af5d0cefb7d7e5408be5e3cbc1302b8de9b314fe0d29511938257e854d81

Observation 2b37f00b-4c98-4816-a4b5-23cac238d526 · outbound

This paper cites Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:13.777666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:09.053089Z digest=sha256:bf15ce5762aa3f8e1bedfda13aee095f154e6d5d2c79b3abc37f820de772243b

Observation 676278fa-89e0-45e1-b6d6-7d401f2740c5 · outbound

This paper cites Controlmllm: Training-free visual prompt learning for multimodal large language models.Advances in Neural Information Processing Systems, 37:45206–45234, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Controlmllm: Training-free visual prompt learning for multimodal large language models.Advances in Neural Information Processing Systems, 37:45206–45234, 2024

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:13.485291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:09.127164Z digest=sha256:2cb5ca56eba31b154afabadf4a5b552351513e292c98ecafc8bd8c28cc80642b

Observation 292ce210-3741-4dda-914c-6c06f64f733c · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.210870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.210870Z digest=sha256:e17dd14c32aa238719e40cc64fdd80e6d4f17ade94d98fc67741f0c224554868

Observation 8038ddba-2872-40b6-9f42-843263afc2fe · outbound

This paper cites Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.279344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.279344Z digest=sha256:e469c0bd86ee03f0d5f66eb4e854f910484394c3b46276a67dda3bb1f77172c3

Observation 5911b287-ce2b-415d-80df-111655e77fde · outbound

This paper cites Microsoft coco: Common objects in context.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Microsoft coco: Common objects in context

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.341142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.341142Z digest=sha256:e537b1184b818b394f2276e1d7f774ab68a0736383ad9c7d8889a8533d10c9d8

Observation 616cbabc-ee87-4b4a-81fc-493b07965263 · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.473336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.473336Z digest=sha256:2f2338dfacf925326b7c2aa58a378294cbeb8b831bd9cf328d09b05f249c6c39

Observation d237af20-3268-40ac-9ecb-2bed4a49397d · outbound

This paper cites mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.565939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.565939Z digest=sha256:2dde39837f7cf424348b1372a9cd276946b1d1ff882824ee1447789bbedd849b

Observation 9f266e29-492b-445e-843a-e74ab1d4d1ef · outbound

This paper cites Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.624040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.624040Z digest=sha256:6b35e85c9b72369c74e71beba651e5e67e5fd176ca9c4f8ec9a44c1a953bc092

Observation c998bba7-4b75-4325-9045-4da573f3b1b5 · outbound

This paper cites Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.693716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.693716Z digest=sha256:f21e0594811f8288c46a1ce7f565945ec39aacdd0d6d92cb20b529bdb04118f3

Observation 0790cc7a-18a6-45b9-8159-75734a52a955 · outbound

This paper cites Blink: Multimodal large language models can see but not perceive.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Blink: Multimodal large language models can see but not perceive

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:13.271348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-07T13:14:09.751122Z digest=sha256:5a1fc6ee03b278b5cbd35f2435ce5e47ee3bf563e4c513d613aba64aac3e02e7

Observation 57157a73-db4f-4cc2-9dca-3a313eb825e2 · outbound

This paper cites A Corpus for Reasoning About Natural Language Grounded in Photographs.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs A Corpus for Reasoning About Natural Language Grounded in Photographs

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.813086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.813086Z digest=sha256:9f70f2eb8bcd49c7cae8dfa2106044d60ddefa6a7e2ad8b937984d960ded63c6

Observation 321334bc-28a5-40ba-b375-c0a6b8148420 · outbound

This paper cites Q-bench: A benchmark for multi-modal foundation models on low-level vision from single images to pairs.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Q-bench: A benchmark for multi-modal foundation models on low-level vision from single images to pairs.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.862080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.862080Z digest=sha256:b10f6fe7cdc5459772181d5e116a79a0bd9b4be7fe8bcd5f6679e6f9a43e50d2

Observation d1f390e2-0e1d-4697-a7f6-530f2d2faf57 · outbound

This paper cites MIBench: Evaluating Multimodal Large Language Models over Multiple Images.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MIBench: Evaluating Multimodal Large Language Models over Multiple Images

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.946184Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.946184Z digest=sha256:0f251da7f7621e523522438b537d0e3ad8ee2d227b6712e9b24b30cc4d114ed7

Observation d568806a-1dfe-431a-b577-79d6cb16f583 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.032271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.032271Z digest=sha256:7d2cd5a920520506fdfc31615fb27113387d77ecbf490f24f4477f1ef3990c3d

Observation fecade87-d7f8-4e4c-a397-1b88685273b1 · outbound

This paper cites Are We on the Right Way for Evaluating Large Vision-Language Models?.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Are We on the Right Way for Evaluating Large Vision-Language Models?

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.120910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.120910Z digest=sha256:751ba186fbb72a3b550e59b647c04fe4179f845d0e81b6bfc111b2146d0d51f0

Observation 4337c286-c758-4461-bdc4-3fc61a4fedd4 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.166520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.166520Z digest=sha256:0b1efdba22ad70a3904a3ef29e62857e79cae6fc44205b8ebb0cee86456a13a7

Observation 69a6f517-05d2-495e-b990-2a2aa6d00c11 · outbound

This paper cites A diagram is worth a dozen images.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs A diagram is worth a dozen images

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.210781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.210781Z digest=sha256:84d18badf3d62cb42cacdd815da4a65125d16f1d8e7b1bc5b283a016d200806e

Observation 90226fa6-d728-4162-9925-18901c45d399 · outbound

This paper cites Evaluating Object Hallucination in Large Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Evaluating Object Hallucination in Large Vision-Language Models

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.325407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.325407Z digest=sha256:7b9cda1f7608dbe5cb7ddab25d5c27f5369dc6d4b44f6573e731ec6b422adf92

Observation 022bb662-11ca-462c-9b9d-8e54356f7a2a · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.401578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.401578Z digest=sha256:3b7b9f31a5c8d198e8f4bf92ff5d5d5e1dcf868d0bda2fd22f9744e6de907a61

Observation 18319a3c-d290-4fcf-8920-7038aa4346d7 · outbound

This paper cites Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.473287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.473287Z digest=sha256:c97688a76505ef5dcc2389e413df464b1d95de43bbafcaf5aff95d017f1b3300

Observation 0bc9fb29-dc0c-40fb-8b1a-65b6daccebc2 · outbound

This paper cites GPT-4 Technical Report.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs GPT-4 Technical Report

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.545631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.545631Z digest=sha256:a36cdfc34877ec20e4bc3a68bbdcd6749aee2ae47840417e472a0153049bf9c8

Observation 3ce90a9c-56f3-45b9-b71d-3fc4a5572dd5 · outbound

This paper cites Needle in a multimodal haystack.Advances in Neural Information Processing Systems, 37:20540–20565, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Needle in a multimodal haystack.Advances in Neural Information Processing Systems, 37:20540–20565, 2024

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.674992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.674992Z digest=sha256:2c40a34041b1e39c8f7f993d4123fd65aec909535ded6d5eab470cc51b2653a2

Observation 7661d267-206a-4624-a7d2-ad635d018b9d · outbound

This paper cites LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.915411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.915411Z digest=sha256:3bbd63d2f6c1cf6fb623f507f8bdb510374cd7e3b4deb74084bcafbb80a721b3

Observation de1b94e6-fcd7-4656-8ffb-d5da17e00351 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.487884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.487884Z digest=sha256:e4d095fb6bf63f36c807ec36f2e0c202896d09f61c90ff88c749499e90dcbd06

Observation 46af83b8-7631-4679-8f6f-34e9a00903f0 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.764663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.764663Z digest=sha256:f1a856cd0ea60d111fa50ac86bfd3a20a12a95d43e9e7f98be37fe1ae46ada08

Observation a367d560-e83e-4c1a-9c08-9bb5995e9579 · outbound

This paper cites Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.846564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.846564Z digest=sha256:2b6c5b3ddd97c44131331b878a348e799d0a18f67d44f754a923247a4d78bec2

Observation f7c6305a-5c86-46a5-8d21-618a957ff359 · outbound

This paper cites CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.965719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.965719Z digest=sha256:2135b9c8fa246a9d9098d944afa4ed8303687c212b09c9f4fdc942cb7942ba45

Observation f3831c0b-52d7-46a1-a6cc-16ab5a63680d · outbound

This paper cites FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension

Reference 88

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:14:12.081333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:12.081333Z digest=sha256:ebae734bb7a801060fc9d386a136971a2ca3f43cc23827177b81835ab276e280

Pith citing papers

No inbound Pith citation observations are available.