Pith. sign in

Paper Citation Record · LEDGER

How Do Vision-Language Models Process Conflicting Information Across Modalities?

As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2507.01790.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.01790 v1

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T20:47:07.903561Z

measured 48 of 48 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 7 of 7 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T01:00:26.919995Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T17:15:52.016694Z

Reference resolution

41 of 41 outbound references displayed

  • verified exact1
  • verified fuzzy14
  • unresolved26
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 81f33fad-f608-4169-ab62-9fcec184c70b · outbound

This paper cites Multimodal biomedical ai.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Multimodal biomedical ai

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.775843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.167374Z digest=sha256:41bd4e11293d9f8929bd402f23b76bda8360d3c199fd1accd4d948ef68a806df

Observation 6d595cf1-56ec-47b9-ba72-ddeadc186849 · outbound

This paper cites Understanding intermediate layers using linear classifier probes.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Understanding intermediate layers using linear classifier probes

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.208420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.208420Z digest=sha256:86d3e14b7d82af9aa728c56a051baca4fb17984718cc3ecad53d418e39aa39a4

Observation 8c09864a-642d-4096-b634-7f795a35f720 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Flamingo: a visual language model for few-shot learning

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.681952Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.286867Z digest=sha256:65675c8a8639abb6fb3fcdf83276af8f722612155b66e97951458b5388919b17

Observation 26f38637-60c2-403e-8948-5ecb129deaba · outbound

This paper cites Qwen2.5-VL Technical Report.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Qwen2.5-VL Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.368750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.368750Z digest=sha256:e6950b62ba3e060d3bc9a0c5da2cdae22869c7167d6f1837be5673ec5620ea63

Observation 04f238e6-90fb-493e-80c5-fe5d5fd89292 · outbound

This paper cites Probing classifiers: Promises, shortcomings, and advances.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Probing classifiers: Promises, shortcomings, and advances

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.435165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.435165Z digest=sha256:dc90c4601cdb52c933db048f7582d779e16e2914443080a80930b2f005c2d7c2

Observation a8ff95b2-42ca-4a9b-a95a-f968dcc63c28 · outbound

This paper cites On the robustness of large multimodal models against image adversarial attacks.

How Do Vision-Language Models Process Conflicting Information Across Modalities? On the robustness of large multimodal models against image adversarial attacks

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.672456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.567710Z digest=sha256:1f7193216e35fb5d66cb39d7de1b8b3f907bd967e46ba2990be7d9df01fa8949

Observation 5dd82d92-11e5-4409-87d0-506b45b03509 · outbound

This paper cites an unresolved cited work.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-06T20:47:11.661002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:03.705815Z digest=sha256:90426f8a6ce60c3a150522e13b14e44bc8ffefe76be56669fdb0c447f13f4328

Observation 921bb0d0-f044-467b-b493-b92e6524b6c4 · outbound

This paper cites Words or Vision: Do Vision-Language Models Have Blind Faith in Text?.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:03.900892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:03.900892Z digest=sha256:d335cc7016e606ebb6baade5aabbc20264f92d0c52f3c8a61f0b74d6a2b200bc

Observation f7efe53c-d129-4982-91bd-484f48087a92 · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Imagenet: A large-scale hierarchical image database

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:04.064194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:04.064194Z digest=sha256:3e45307b536d456447abfb9bee38157da8b4ade8bb9413bc2f92176b41a163e3

Observation 1b330963-4990-4baa-a8ad-3333f6fcf127 · outbound

This paper cites The pascal visual object classes (voc) challenge.

How Do Vision-Language Models Process Conflicting Information Across Modalities? The pascal visual object classes (voc) challenge

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:04.232791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:04.232791Z digest=sha256:52d45009682b837bf4b6cd98d348692ef481420ec5c23b1a40632bbad33a8c8c

Observation d8e1b6d8-03f9-410f-b75b-59f6b38387d5 · outbound

This paper cites Pixels versus priors: Controlling knowledge priors in vision-language models through visual counterfacts.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Pixels versus priors: Controlling knowledge priors in vision-language models through visual counterfacts

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:04.394039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:04.394039Z digest=sha256:c2eb800351d208df39e535c41a748bd1165e09d6ef79477743a5aa7874db3256

Observation c58d2bf2-5ac0-4aac-9135-1e7583da58b1 · outbound

This paper cites What do VLM s NOTICE ? a mechanistic interpretability pipeline for G aussian-noise-free text-image corruption and evaluation.

How Do Vision-Language Models Process Conflicting Information Across Modalities? What do VLM s NOTICE ? a mechanistic interpretability pipeline for G aussian-noise-free text-image corruption and evaluation

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.373646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:04.559268Z digest=sha256:d210ada5cecd02de4e9e87326263958f859fd68c0f0704e5c80291cb33020c28

Observation 219fdcb1-a9dc-46e2-894a-0bfa23f61067 · outbound

This paper cites How does GPT -2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model.

How Do Vision-Language Models Process Conflicting Information Across Modalities? How does GPT -2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:11.040573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:04.726134Z digest=sha256:dfe72f1c8fa4db00c06baa4f7e00e01a0e27112323130e80d6d6f9cf6f216223

Observation eacdb6e6-0dc5-4f5a-a378-24aacb8a8d4d · outbound

This paper cites an unresolved cited work.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-06T20:47:10.677191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:04.858328Z digest=sha256:6390632e3cfa631b6faa391c130756e00c123255a89c306c396a986c10bef37e

Observation 5f5bd9f7-d638-4adb-a967-910e90828056 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Adam: A Method for Stochastic Optimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:05.021127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:05.021127Z digest=sha256:b1901403b3334a938068f9ad430f0594b9d25c889eec692f8b1e4b90a5b76e7d

Observation 9f6745f4-7f2e-40e3-9df7-942bb196b3cc · outbound

This paper cites Learning multiple layers of features from tiny images.(2009), 2009.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Learning multiple layers of features from tiny images.(2009), 2009

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:05.200094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:05.200094Z digest=sha256:200772e57ab65a5dd2928a2db2f636aee7d79ee9950b4c1e4557a0c236f538db

Observation 948663c9-e9f1-4b37-8be8-10e5ca903714 · outbound

This paper cites Beyond the doors of perception: Vision transformers represent relations between objects.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Beyond the doors of perception: Vision transformers represent relations between objects

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:10.367160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:05.331504Z digest=sha256:7b0064495eda5731971b71e6df7fcf92cd907f3aa26ca721b75ada6fc00f7c6b

Observation c6a79849-c175-4e02-a595-9753ee31a037 · outbound

This paper cites LL a VA -onevision: Easy visual task transfer.

How Do Vision-Language Models Process Conflicting Information Across Modalities? LL a VA -onevision: Easy visual task transfer

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:10.174208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:05.533823Z digest=sha256:e8005f2ebbfb3421547d18e22db797e60b4d2af0d33534976865692ac5f63372

Observation a7aab324-ef49-4635-a7d8-1afb4b707de1 · outbound

This paper cites Inference-time intervention: Eliciting truthful answers from a language model.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Inference-time intervention: Eliciting truthful answers from a language model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:05.693814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:05.693814Z digest=sha256:82b8d84c4c38b1d61cd711a63e6a271fdade4021a73dfa3e9add33720de6f3d3

Observation 88497041-3c36-4e81-98c0-491e01213a2f · outbound

This paper cites Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-06T20:47:08.457560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:05.868757Z digest=sha256:77acafb9ac2ca5b9b2088b5bc1be7b55ab12d13aa93ca37fea455407b0de649e

Observation 1a037fbd-c560-40f1-aafa-e548c41e9a26 · outbound

This paper cites Improved baselines with visual instruction tuning, 2023.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Improved baselines with visual instruction tuning, 2023

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.023717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.023717Z digest=sha256:aac68c68537358a8f8f6cd0ac715fd0749eaba6f0adcde1fdcd19dcfa777706e

Observation 49b6407e-6b08-4795-83df-bbc8955a76a8 · outbound

This paper cites The quest for the right mediator: A history, survey, and theoretical grounding of causal interpretability.

How Do Vision-Language Models Process Conflicting Information Across Modalities? The quest for the right mediator: A history, survey, and theoretical grounding of causal interpretability

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.133530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.133530Z digest=sha256:f736c41a983452ed3fd2afaf5a55a0d3eae4215832a1c2e6f79ee7136c0b262e

Observation 835729aa-e31d-4519-90a5-7c51c4c1ff2d · outbound

This paper cites Towards interpreting visual information processing in vision-language models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Towards interpreting visual information processing in vision-language models

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.966918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.237627Z digest=sha256:b5df383d8d931ff4508bfa5b08e6c39d36d30f18b72875168bb9fe8d9fd07380

Observation 78824f13-9509-4b94-8d80-070aee0ff6c5 · outbound

This paper cites Same task, different circuits: Disentangling modality-specific mechanisms in vlms.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Same task, different circuits: Disentangling modality-specific mechanisms in vlms

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.342412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.342412Z digest=sha256:66220809ed9c55e0f450d2d43e611139b985cf2a489c5fdfba0bd23921b8e449

Observation 4045827d-8ad6-4910-aef7-c948e23bd086 · outbound

This paper cites Introducing operator.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Introducing operator

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.786996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.444748Z digest=sha256:dc5e05525a1f0ce2b8de21fbae7851e45f0c0ba6b0869ffe76127d9cf1f4b2f1

Observation a68d5511-6e85-4683-8fb3-0e6847d566ba · outbound

This paper cites GPT-4 Technical Report.

How Do Vision-Language Models Process Conflicting Information Across Modalities? GPT-4 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.548025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.548025Z digest=sha256:d78b75d677b2c9d4c69d4f089671d11c79ff99f12f6c64eb34e01bbe6d2522e3

Observation f206f484-5183-40d2-a623-9fcab1b725fd · outbound

This paper cites Interpreting the linear structure of vision-language model embedding spaces.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Interpreting the linear structure of vision-language model embedding spaces

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.627050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.627050Z digest=sha256:11a628d9d1bdf0fe2529f7488ad0c324c7c1b61e2ef282c334faed6badeb02ac

Observation bd9f27a9-779d-4f5d-9fa9-6b5c4f9df9a6 · outbound

This paper cites V -measure: A conditional entropy-based external cluster evaluation measure.

How Do Vision-Language Models Process Conflicting Information Across Modalities? V -measure: A conditional entropy-based external cluster evaluation measure

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.607422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.718852Z digest=sha256:a4d9a31148b3ef8673ed0cd0aeee4de8c33138e8d30561a6d240dddb51eabab6

Observation 490fa9ea-1e47-4873-b46e-c7600c1a4bab · outbound

This paper cites On the Adversarial Robustness of Multi-Modal Foundation Models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? On the Adversarial Robustness of Multi-Modal Foundation Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:06.822297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:06.822297Z digest=sha256:f5bda9c2daa9e56d195df37830174a61de0c57c5ec43b190881656abb3a53aa8

Observation 27494d1a-1258-4ee3-8986-4321e9c8df62 · outbound

This paper cites What do you learn from context? probing for sentence structure in contextualized word representations.

How Do Vision-Language Models Process Conflicting Information Across Modalities? What do you learn from context? probing for sentence structure in contextualized word representations

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.418278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:06.925496Z digest=sha256:1cbd03f57c6a9a79d31197cc6ad9166a993cb246b63e428ea329ed5c2d999360

Observation 13cb4d14-85a6-4c25-978d-617ffba7998b · outbound

This paper cites Bert rediscovers the classical nlp pipeline.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Bert rediscovers the classical nlp pipeline

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.236606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:07.030149Z digest=sha256:53fedd08a92db810069c8dbff248941880febe424344fa67112f86bb52c36be2

Observation 355d1c63-4f5c-4747-8764-fd6dccae3cb5 · outbound

This paper cites Investigating gender bias in language models using causal mediation analysis.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Investigating gender bias in language models using causal mediation analysis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.129570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.129570Z digest=sha256:3606acfde72c00802f00f120b10ae0f33c4f847db75a6734bc682a2fb41a5f0f

Observation 2dec1286-d704-46a3-a389-0369d48bd845 · outbound

This paper cites Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.202331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.202331Z digest=sha256:890ae062b9f64fed48fadeed5c02579e313eb0766f0c9bceaa55eb07066b4d3c

Observation 7c22cf30-9bc8-4c25-b8de-56ac146da63a · outbound

This paper cites The caltech-ucsd birds-200-2011 dataset.

How Do Vision-Language Models Process Conflicting Information Across Modalities? The caltech-ucsd birds-200-2011 dataset

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.294072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.294072Z digest=sha256:94effede4e7bf941e54622ccf44cc1b73abbea3664e9e3496d0efe55f60b86ad

Observation 85216b34-3275-4f8e-8904-190d27a6f832 · outbound

This paper cites Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.394735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.394735Z digest=sha256:1c2b7ce2be0bf0046f3a3f803de989207896efdb21da60b4bfe5695343c314a8

Observation be17bcbc-6a94-4caf-9ef8-f2d0e315a1ea · outbound

This paper cites Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.466049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.466049Z digest=sha256:4ab2324faa6818a6f03127e2e0f2c0b95a83f01b932a6b2cb8edddc597c79556

Observation cce0599b-a114-4793-bb89-cf434f2a65d5 · outbound

This paper cites Characterizing mechanisms for factual recall in language models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Characterizing mechanisms for factual recall in language models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.551656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.551656Z digest=sha256:fa27526f41d61f25f533da5901f1bf22f573fa64fb44e0d73346bbc67b29e870

Observation 22a2a9d2-601a-437d-925d-a220b9229005 · outbound

This paper cites Does vision-and-language pretraining improve lexical grounding? In Findings of the Association for Computational Linguistics: EMNLP 2021, pages 4357--4366, 2021.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Does vision-and-language pretraining improve lexical grounding? In Findings of the Association for Computational Linguistics: EMNLP 2021, pages 4357--4366, 2021

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:09.052513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:07.648337Z digest=sha256:5c4b1c6f61aebae2aa5988312924bd66a9cee69ebeec1f95a07ea3223db4dfa1

Observation 1027564e-6fa4-4942-bd0d-549b07549037 · outbound

This paper cites Emergence of abstract state representations in embodied sequence modeling.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Emergence of abstract state representations in embodied sequence modeling

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:47:08.751769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-06T20:47:07.710731Z digest=sha256:26ee10bb1c186e30bebd5b67b80fd53baac5f115de462a680ff0ce76508aecce

Observation 658b2ef7-f1d6-4d56-b06a-25407e037b18 · outbound

This paper cites Calling a spade a heart: Gaslighting multimodal large language models via negation, 2025.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Calling a spade a heart: Gaslighting multimodal large language models via negation, 2025

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.809459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.809459Z digest=sha256:1b30ff1e492934f6e0d1f13a71c0b284a9ab5b192616e5be5c508040a341c3ae

Observation 9c47deb8-34ed-426f-b729-1e8ce3c23b4d · outbound

This paper cites Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models.

How Do Vision-Language Models Process Conflicting Information Across Modalities? Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T20:47:07.903561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:47:07.903561Z digest=sha256:46dc9c4e0817d1432ca7d8bfe03bd25d630c0df79e24a6dc6d9d2f0c4d89fb1b

Pith citing papers

Observation f9767cf6-0900-4952-9bfb-3c0ca9bc9db0 · inbound

Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability cites this paper.

Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T01:00:26.919995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T01:00:26.919995Z digest=sha256:b4dd0e903d9cf7c63c7e2140e7b5258ab3d9dfd4d66ff552cc1a7e6631ebeeca

Observation 0c9086df-9a57-439d-a560-1ad63b475312 · inbound

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds cites this paper.

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-17T06:01:34.739667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-17T05:59:14.478279Z digest=sha256:b750debb341c146faaffe7b17198c23280d492dbdc6b0e268133024253a9e83a

Observation 524773b5-315c-4eac-8bf8-a010888435df · inbound

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models cites this paper.

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:11:53.710872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-10T07:02:02.752466Z digest=sha256:d92c6a2cfd4cfafb742eb07d84e75a6670fe96345d61282e4d98c04cd27ebf08

Observation 854e9a80-1a6a-48de-8edb-a3c3607b15ab · inbound

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models cites this paper.

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T17:15:52.018576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-29T03:53:04.984303Z digest=sha256:2b0d4adcc5e0baea7d493ea194421c277686929fa83f732c279248c31fd79cf6

Observation cf1015e8-e448-412d-a1fd-3f9e5624e96b · inbound

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models cites this paper.

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-06-30T07:14:21.583728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-30T07:06:36.599771Z digest=sha256:6ced7c6214fa511f7a88654f1e8a5882492d866b8023a76e26416a969cf443d9

Observation 218f5833-c688-4f6d-b7e9-af96fcff062a · inbound

Attending to Multimodal Generation One Token at a Time cites this paper.

Attending to Multimodal Generation One Token at a Time How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-12T00:17:46.528896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T00:17:46.528896Z digest=sha256:521a4f0ba980a1ff1246472e3b999dee2e7c5ad7c494bf37fe33efa2ea3231e1

Observation a0acd5ca-061f-4b96-8016-9cd40cbb5726 · inbound

Linguistic Context Recodes Visual Representations in Vision-Language Models cites this paper.

Linguistic Context Recodes Visual Representations in Vision-Language Models How Do Vision-Language Models Process Conflicting Information Across Modalities?

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T01:41:52.790018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T01:41:52.790018Z digest=sha256:de5e8e903307f8f566784d031bdc988f245c9bfdea030b5bb25a8226de562e4e