Pith. sign in

Paper Citation Record · LEDGER

How Do Vision-Language Models Process Conflicting Information Across Modalities?

As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 8 inbound Pith citation observations for arXiv:2507.01790.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.01790 v1

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T20:47:07.903561Z

measured 49 of 49 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T11:07:46.242486Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T17:15:52.016694Z

Reference resolution

41 of 41 outbound references displayed

  • verified exact1
  • verified fuzzy14
  • unresolved26
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 81f33fad-f608-4169-ab62-9fcec184c70b · outbound

This paper cites Multimodal biomedical ai.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Multimodal biomedical ai

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.775843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.167374Z digest=sha256:0fb37887ea72de95ed8ff225197b0caa0acba3429878d9099855e45c50a8d1ff

Observation 6d595cf1-56ec-47b9-ba72-ddeadc186849 · outbound

This paper cites Understanding intermediate layers using linear classifier probes.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Understanding intermediate layers using linear classifier probes

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.208420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.208420Z digest=sha256:a690251827c827718403920ddbc6084138af3fd81cb112477319fc68697e9bbe

Observation 8c09864a-642d-4096-b634-7f795a35f720 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Flamingo: a visual language model for few-shot learning

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.681952Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.286867Z digest=sha256:ff6df68a4f7be92ff8a6f995ff6fa1bd12d8e7826023ea9bf1f7ccc699c22e8d

Observation 26f38637-60c2-403e-8948-5ecb129deaba · outbound

This paper cites Qwen2.5-VL Technical Report.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Qwen2.5-VL Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.368750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.368750Z digest=sha256:5fafb8906aa2285d64e6f4d741c570e941cf8c55945ed38ee5f2022d4f18035d

Observation 04f238e6-90fb-493e-80c5-fe5d5fd89292 · outbound

This paper cites Probing classifiers: Promises, shortcomings, and advances.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Probing classifiers: Promises, shortcomings, and advances

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.435165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.435165Z digest=sha256:3501aaabb6e4c6c4af64568b93cb48c16c013701132c76bb9da4887af561ee3e

Observation a8ff95b2-42ca-4a9b-a95a-f968dcc63c28 · outbound

This paper cites On the robustness of large multimodal models against image adversarial attacks.

How Do Vision-Language Models Process Conflicting Information Across Modalities? On the robustness of large multimodal models against image adversarial attacks

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.672456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.567710Z digest=sha256:fb8cbce6f8d5902ea11cd3b6d5d9cdd8103e791580b2ae40bcf156f71daac40d

Observation 5dd82d92-11e5-4409-87d0-506b45b03509 · outbound

This paper cites an unresolved cited work.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-06T20:47:11.661002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.705815Z digest=sha256:b31acc83ccffce7e5aacfa140e7b934f2ec88eb9a42e3fe5d64bed5aa39f3b80

Observation 921bb0d0-f044-467b-b493-b92e6524b6c4 · outbound

This paper cites Words or Vision: Do Vision-Language Models Have Blind Faith in Text?.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.900892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.900892Z digest=sha256:21175a836a48305e078c1c33acfd520731b1947f0c13428c0af78a87987a718f

Observation f7efe53c-d129-4982-91bd-484f48087a92 · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Imagenet: A large-scale hierarchical image database

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:04.064194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:04.064194Z digest=sha256:fb2b2a6653289d530846a4a4bb8e2cedcb84848ca5737be213ef12f1b9ce88a6

Observation 1b330963-4990-4baa-a8ad-3333f6fcf127 · outbound

This paper cites The pascal visual object classes (voc) challenge.

How Do Vision-Language Models Process Conflicting Information Across Modalities? The pascal visual object classes (voc) challenge

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:04.232791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:04.232791Z digest=sha256:e5c344ffc187deed36c9e8e30aac03384b38cc52080ec38644b7cd9eed477482

Observation d8e1b6d8-03f9-410f-b75b-59f6b38387d5 · outbound

This paper cites Pixels versus priors: Controlling knowledge priors in vision-language models through visual counterfacts.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Pixels versus priors: Controlling knowledge priors in vision-language models through visual counterfacts

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:04.394039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:04.394039Z digest=sha256:4503a1f61acb62f4d32caccf50d03584e1e188cf0f31004eb05cb605c40ca037

Observation c58d2bf2-5ac0-4aac-9135-1e7583da58b1 · outbound

This paper cites What do VLM s NOTICE ? a mechanistic interpretability pipeline for G aussian-noise-free text-image corruption and evaluation.

How Do Vision-Language Models Process Conflicting Information Across Modalities? What do VLM s NOTICE ? a mechanistic interpretability pipeline for G aussian-noise-free text-image corruption and evaluation

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.373646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:04.559268Z digest=sha256:fd99040bf942c51243c688d3043d5b4b354f1f475f30f027854770cebd410d80

Observation 219fdcb1-a9dc-46e2-894a-0bfa23f61067 · outbound

This paper cites How does GPT -2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model.

How Do Vision-Language Models Process Conflicting Information Across Modalities? How does GPT -2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.040573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:04.726134Z digest=sha256:89e55580d23d9a4fcbd7fbb2051afd8b009799873feaddee0fe469a0c65c97ad

Observation eacdb6e6-0dc5-4f5a-a378-24aacb8a8d4d · outbound

This paper cites an unresolved cited work.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-06T20:47:10.677191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:04.858328Z digest=sha256:bad7c2d5b2ce71698417a4e96bbb2d1b668023aee257593c5ebdf589d7118241

Observation 5f5bd9f7-d638-4adb-a967-910e90828056 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Adam: A Method for Stochastic Optimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:05.021127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:05.021127Z digest=sha256:56fe16e722761c9c02d37d6d4b5e38e044fba9a855e9a6c4d4eeebbda82fe234

Observation 9f6745f4-7f2e-40e3-9df7-942bb196b3cc · outbound

This paper cites Learning multiple layers of features from tiny images.(2009), 2009.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Learning multiple layers of features from tiny images.(2009), 2009

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:05.200094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:05.200094Z digest=sha256:d5fd9f724b632afd80016df0cb0c614586a76f3f4e106eeb9c9f2f7854be54aa

Observation 948663c9-e9f1-4b37-8be8-10e5ca903714 · outbound

This paper cites Beyond the doors of perception: Vision transformers represent relations between objects.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Beyond the doors of perception: Vision transformers represent relations between objects

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:10.367160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:05.331504Z digest=sha256:d55b1e94f71e906ff51fce6f246d0a62eb2f81c89599ddd5ec4bbab7746a709b

Observation c6a79849-c175-4e02-a595-9753ee31a037 · outbound

This paper cites LL a VA -onevision: Easy visual task transfer.

How Do Vision-Language Models Process Conflicting Information Across Modalities? LL a VA -onevision: Easy visual task transfer

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:10.174208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:05.533823Z digest=sha256:f6618570bfc4acc857433aeb158608c209799acd08e0c4b2d89cbef5e33c96f4

Observation a7aab324-ef49-4635-a7d8-1afb4b707de1 · outbound

This paper cites Inference-time intervention: Eliciting truthful answers from a language model.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Inference-time intervention: Eliciting truthful answers from a language model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:05.693814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:05.693814Z digest=sha256:9362983bc07150b24c0b69c890f99f09ac3ae01f5af82bf053e513c9a377c69b

Observation 88497041-3c36-4e81-98c0-491e01213a2f · outbound

This paper cites Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-06T20:47:08.457560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:05.868757Z digest=sha256:c3748e6a55d2f9b265e45edb4bbc85eb03baff277e67f58e5d4c25ee03f43c98

Observation 1a037fbd-c560-40f1-aafa-e548c41e9a26 · outbound

This paper cites Improved baselines with visual instruction tuning, 2023.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Improved baselines with visual instruction tuning, 2023

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.023717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.023717Z digest=sha256:99b4d8cf12f033c5f53b3c8043fc976d508b6c7d87b95e7ac6024bd76faad0bc

Observation 49b6407e-6b08-4795-83df-bbc8955a76a8 · outbound

This paper cites The quest for the right mediator: A history, survey, and theoretical grounding of causal interpretability.

How Do Vision-Language Models Process Conflicting Information Across Modalities? The quest for the right mediator: A history, survey, and theoretical grounding of causal interpretability

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.133530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.133530Z digest=sha256:77d6d1600d82191bac82a930b0c2d4dbad08f1a8dacb4f28c870beaf2a8a529f

Observation 835729aa-e31d-4519-90a5-7c51c4c1ff2d · outbound

This paper cites Towards interpreting visual information processing in vision-language models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Towards interpreting visual information processing in vision-language models

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.966918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.237627Z digest=sha256:eace11c7ecac1cbba0169ea161e21fb2f9e93f00e3f401592210e42ba62c10f8

Observation 78824f13-9509-4b94-8d80-070aee0ff6c5 · outbound

This paper cites Same task, different circuits: Disentangling modality-specific mechanisms in vlms.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Same task, different circuits: Disentangling modality-specific mechanisms in vlms

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.342412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.342412Z digest=sha256:a1be56ae25220da13a567bfed778da781ed9346aa616b8d0c67f524e358de193

Observation 4045827d-8ad6-4910-aef7-c948e23bd086 · outbound

This paper cites Introducing operator.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Introducing operator

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.786996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.444748Z digest=sha256:216d6bef4172b478d987af185bddc4aa83a3473263301e65a16af54db22f080f

Observation a68d5511-6e85-4683-8fb3-0e6847d566ba · outbound

This paper cites GPT-4 Technical Report.

How Do Vision-Language Models Process Conflicting Information Across Modalities? GPT-4 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.548025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.548025Z digest=sha256:bc57747296879a1e05fcc0e44878feacf34f8e0c16132619bc9b5e9b0d97769a

Observation f206f484-5183-40d2-a623-9fcab1b725fd · outbound

This paper cites Interpreting the linear structure of vision-language model embedding spaces.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Interpreting the linear structure of vision-language model embedding spaces

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.627050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.627050Z digest=sha256:fd76f0939d8a70a0b078bf96c2a4084ebafe0418df0129d353e6238206f1ab20

Observation bd9f27a9-779d-4f5d-9fa9-6b5c4f9df9a6 · outbound

This paper cites V -measure: A conditional entropy-based external cluster evaluation measure.

How Do Vision-Language Models Process Conflicting Information Across Modalities? V -measure: A conditional entropy-based external cluster evaluation measure

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.607422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.718852Z digest=sha256:92ed11c782822b46d9201108a5b2ac5df74fe578262436245c01be13e3994859

Observation 490fa9ea-1e47-4873-b46e-c7600c1a4bab · outbound

This paper cites On the Adversarial Robustness of Multi-Modal Foundation Models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? On the Adversarial Robustness of Multi-Modal Foundation Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.822297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.822297Z digest=sha256:8a64fe3084b6366f167abe6b88d5d01a9681aef08184141c86eec8028e901589

Observation 27494d1a-1258-4ee3-8986-4321e9c8df62 · outbound

This paper cites What do you learn from context? probing for sentence structure in contextualized word representations.

How Do Vision-Language Models Process Conflicting Information Across Modalities? What do you learn from context? probing for sentence structure in contextualized word representations

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.418278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.925496Z digest=sha256:cf5c3a68edf519641007656c1831388730a247873c0ffea823e3c8e523ebe094

Observation 13cb4d14-85a6-4c25-978d-617ffba7998b · outbound

This paper cites Bert rediscovers the classical nlp pipeline.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Bert rediscovers the classical nlp pipeline

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.236606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:07.030149Z digest=sha256:bbfbe7b09b3428e976bea47228fe455a5a77b4651c6cbb0051ffdc0891e3c4c6

Observation 355d1c63-4f5c-4747-8764-fd6dccae3cb5 · outbound

This paper cites Investigating gender bias in language models using causal mediation analysis.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Investigating gender bias in language models using causal mediation analysis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.129570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.129570Z digest=sha256:5cfd4815772917aba56d88768e7b933979c53e31bb0937be80b2dcda5ad3e23d

Observation 2dec1286-d704-46a3-a389-0369d48bd845 · outbound

This paper cites Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.202331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.202331Z digest=sha256:24740b76886c42189b9a10c73171ad0e7b6b09e509db8f2ae333ff377f23ca5c

Observation 7c22cf30-9bc8-4c25-b8de-56ac146da63a · outbound

This paper cites The caltech-ucsd birds-200-2011 dataset.

How Do Vision-Language Models Process Conflicting Information Across Modalities? The caltech-ucsd birds-200-2011 dataset

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.294072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.294072Z digest=sha256:695bb7a0012a15391abcd340d95ad11490a6708d771a153635553cd734d296d5

Observation 85216b34-3275-4f8e-8904-190d27a6f832 · outbound

This paper cites Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.394735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.394735Z digest=sha256:3241d6ffda79e07720880d58dc22e1c9cdba03f711f7bf3f404a95852526f721

Observation be17bcbc-6a94-4caf-9ef8-f2d0e315a1ea · outbound

This paper cites Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.466049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.466049Z digest=sha256:1cbf4031bf0ca6ca86cd1cf23afa922ace4247ec0b5850714ab9f1bfa59b7165

Observation cce0599b-a114-4793-bb89-cf434f2a65d5 · outbound

This paper cites Characterizing mechanisms for factual recall in language models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Characterizing mechanisms for factual recall in language models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.551656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.551656Z digest=sha256:b9032e4bc1b89417488ff65e5637f5896a65ac9c81939cd005351ae004970cae

Observation 22a2a9d2-601a-437d-925d-a220b9229005 · outbound

This paper cites Does vision-and-language pretraining improve lexical grounding? In Findings of the Association for Computational Linguistics: EMNLP 2021, pages 4357--4366, 2021.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Does vision-and-language pretraining improve lexical grounding? In Findings of the Association for Computational Linguistics: EMNLP 2021, pages 4357--4366, 2021

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.052513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:07.648337Z digest=sha256:bf0d799d42b7d0f20ef72c50311bebf715984a9bd25d90216e1cdef3e9da6444

Observation 1027564e-6fa4-4942-bd0d-549b07549037 · outbound

This paper cites Emergence of abstract state representations in embodied sequence modeling.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Emergence of abstract state representations in embodied sequence modeling

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:08.751769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-06T20:47:07.710731Z digest=sha256:e182b5a626532fcce3147bb8d66d5cc8ec18bdc13e8173e929d500a6ab77270c

Observation 658b2ef7-f1d6-4d56-b06a-25407e037b18 · outbound

This paper cites Calling a spade a heart: Gaslighting multimodal large language models via negation, 2025.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Calling a spade a heart: Gaslighting multimodal large language models via negation, 2025

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.809459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.809459Z digest=sha256:6c5724e1d938b0743af6061c816fe46de7a6cadbdb48df938dc36808f3989a7a

Observation 9c47deb8-34ed-426f-b729-1e8ce3c23b4d · outbound

This paper cites Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.903561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.903561Z digest=sha256:b496989649014ca6a3143bb56077bae61fe2ce29f26abfd5ded471813196731d

Pith citing papers

Observation f9767cf6-0900-4952-9bfb-3c0ca9bc9db0 · inbound

Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability cites this paper.

Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T01:00:26.919995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T01:00:26.919995Z digest=sha256:a8e69ad9ee9220b10118fb3dee962092818017237a7a1474c99977bf9a3585c4

Observation 0c9086df-9a57-439d-a560-1ad63b475312 · inbound

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds cites this paper.

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-17T06:01:34.739667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-17T05:59:14.478279Z digest=sha256:8d2b08e127514e4c899c562ab9688841be63b092663c6b3147a7499890dfb963

Observation 524773b5-315c-4eac-8bf8-a010888435df · inbound

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models cites this paper.

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:11:53.710872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-10T07:02:02.752466Z digest=sha256:762040c12916b40a651d3e07bcc4f33170b0542b93a894a0205a038519c10154

Observation 854e9a80-1a6a-48de-8edb-a3c3607b15ab · inbound

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models cites this paper.

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T17:15:52.018576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-29T03:53:04.984303Z digest=sha256:6f006cecad865ddb2a8fb148fc098b92d0968c6582c95a28221e73bc2f4fe386

Observation cf1015e8-e448-412d-a1fd-3f9e5624e96b · inbound

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models cites this paper.

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-06-30T07:14:21.583728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-30T07:06:36.599771Z digest=sha256:54f7ff7ad4a7bbe364498cc41a92c4de8db0a60b5f69f968d7096acaac51c1d0

Observation 218f5833-c688-4f6d-b7e9-af96fcff062a · inbound

Attending to Multimodal Generation One Token at a Time cites this paper.

Attending to Multimodal Generation One Token at a Time How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-12T00:17:46.528896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T00:17:46.528896Z digest=sha256:cdcb1bcafe6d15c92a8da34e1ec99e61ba7a4e70cbad116b1eb0b43dd353b910

Observation a0acd5ca-061f-4b96-8016-9cd40cbb5726 · inbound

Linguistic Context Recodes Visual Representations in Vision-Language Models cites this paper.

Linguistic Context Recodes Visual Representations in Vision-Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T01:41:52.790018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T01:41:52.790018Z digest=sha256:ae4b22399340b38f6837b97bce8c57f6b7d9744ab9570c1513a6ee5050d8a195

Observation c362de38-7834-40c6-885b-21f210e261b2 · inbound

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models cites this paper.

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T11:07:46.242486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T11:07:46.242486Z digest=sha256:d677774c029f21f37bd3d1f9d5ee140ddcaa4e8f643894970e3bd1802c01a433