Pith. sign in

Paper Citation Record · LEDGER

Cross-Modal Consistency in Multimodal Large Language Models

As of 16 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 4 inbound Pith citation observations for arXiv:2411.09273.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.09273 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T20:54:07.527927Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T16:32:43.411887Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T09:17:48.857417Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact2
  • verified fuzzy0
  • unresolved22
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 49fb75d3-f0aa-4821-8dfe-33e148385ad4 · outbound

This paper cites Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond.

Cross-Modal Consistency in Multimodal Large Language Models Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.420201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.420201Z digest=sha256:ff2066d0c2974f62a9ff73600c3fbceb654de3c68b9ed7ec9631096881406877

Observation faa740de-faa2-4496-b262-29ae9ea5a219 · outbound

This paper cites MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs).

Cross-Modal Consistency in Multimodal Large Language Models MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.425517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.425517Z digest=sha256:2e58a5a5c08c854e53d48770ad1e68b6e143a3b403472b00ed7460e52c3bb9ad

Observation b3811fd5-be4e-43cc-a819-00870e45961f · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Cross-Modal Consistency in Multimodal Large Language Models Training Verifiers to Solve Math Word Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.430200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.430200Z digest=sha256:b08c00fe0e91ea0b7d9fa399ed69fbfd935e9a2ab2cbb9ebdf6d0e88b698cf07

Observation 742b6e9c-60a9-47cd-8b58-1032967471b7 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Cross-Modal Consistency in Multimodal Large Language Models PaLM-E: An Embodied Multimodal Language Model

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.435149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.435149Z digest=sha256:d3753494f5a878e60f411844256da3d710b7d586740859dd9664639a92e00cbf

Observation 5a1cc206-3f42-45bf-90ef-eed5b2167bfa · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Cross-Modal Consistency in Multimodal Large Language Models Measuring Massive Multitask Language Understanding

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.440685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.440685Z digest=sha256:0107315847a9127feb988ee87f12f214b423ea5957f3d75c2482931cd88b6ef7

Observation 8e622d49-26e7-4857-ba10-f8cf0bd48ac5 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Cross-Modal Consistency in Multimodal Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.446103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.446103Z digest=sha256:b7c7d55acc47afdd091ef452e09c1293053de8d940bd305e106e4e6d1fa98c43

Observation ce548a52-605d-4522-a6f4-de712a00fa19 · outbound

This paper cites PromptCap: Prompt-Guided Task-Aware Image Captioning.

Cross-Modal Consistency in Multimodal Large Language Models PromptCap: Prompt-Guided Task-Aware Image Captioning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.451241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.451241Z digest=sha256:de37874d46c362f69ab676fda72279edbcb85cc5465d76164a528bf3bb0f26c8

Observation 173395fb-7368-4c4f-b63f-80dfdb7132cc · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-12T20:54:07.872469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.455776Z digest=sha256:c2f53c2acdd1c3a34e1c1114e3a3eefaa54c9e7fd7560fe5ff4c5c2c16eaa04a

Observation 25788515-cd77-4579-a5e9-2a1afa0ef717 · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-12T20:54:07.858897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.460798Z digest=sha256:c5f1fa5ae10e417be9ae246f02b9931275a19b62b07f9620bd0dd14fc5097a1e

Observation 708ae07d-8d11-44b7-bf6f-151d4b416632 · outbound

This paper cites REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering.

Cross-Modal Consistency in Multimodal Large Language Models REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-12T20:54:07.731682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.465522Z digest=sha256:f42641c299f5de06c32c32e48a95f11d700776075569ed3e4121db15306e11a1

Observation 169630e9-0429-494f-9a41-dc87ed48384c · outbound

This paper cites MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning.

Cross-Modal Consistency in Multimodal Large Language Models MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.469910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.469910Z digest=sha256:c59ac1ebb4c15c0ed5d94cc779fb1371eb9d141a46442e71cc6ba4b24271ce9d

Observation e5630906-671a-4101-a529-86440425b3af · outbound

This paper cites LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning.

Cross-Modal Consistency in Multimodal Large Language Models LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.474475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.474475Z digest=sha256:6632708eea0e5ccad05c2eece65432d4c35a831cfbb2d376769ac2f56dbba3d4

Observation dfad09cf-86c1-47c4-928a-d901d0ce2fb9 · outbound

This paper cites Holistic Evaluation of GPT-4V for Biomedical Imaging.

Cross-Modal Consistency in Multimodal Large Language Models Holistic Evaluation of GPT-4V for Biomedical Imaging

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.478765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.478765Z digest=sha256:c72606aeeba87f77057cff9538a0d312382057aa33a1fb9cb4a32a86c0bd1f4c

Observation 71c677c3-a823-455f-8497-157ebd9d8833 · outbound

This paper cites Learning Transferable Visual Models From Natural Language Supervision.

Cross-Modal Consistency in Multimodal Large Language Models Learning Transferable Visual Models From Natural Language Supervision

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.483516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.483516Z digest=sha256:6d9959da0f209b71b1ef6267a7beef5c53cc4231187535dcff687760497dc73e

Observation 747fecb6-0335-46e2-92d3-675deca4df85 · outbound

This paper cites Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation.

Cross-Modal Consistency in Multimodal Large Language Models Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.487795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.487795Z digest=sha256:ab7ef1a9f5b89189bc23051da50bf2851e85b909ca0ce541d4005bca53332943

Observation 60417d2c-4c4c-42ff-aa95-11c697188820 · outbound

This paper cites On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving.

Cross-Modal Consistency in Multimodal Large Language Models On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.492582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.492582Z digest=sha256:fc0f149b93f0dcdaec058f963725a38d03b13a7092f25c8003fabab0118ba92a

Observation 8cbd03d4-cb4a-48de-bce0-0ff089a6e322 · outbound

This paper cites Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis.

Cross-Modal Consistency in Multimodal Large Language Models Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.496787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.496787Z digest=sha256:75576b6168d04b5f707cbea7a50c62af455b7fe1e2a742624faeaa92d32af14b

Observation df4ba4a0-9376-4e86-b025-ed0616e0cbac · outbound

This paper cites The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision).

Cross-Modal Consistency in Multimodal Large Language Models The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.501393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.501393Z digest=sha256:5928f15490870cf051103a9d6dcda2a898163013e61c36df64055fb51a8dac53

Observation a7b99f50-89af-42a4-9dd8-568a1248705d · outbound

This paper cites TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models.

Cross-Modal Consistency in Multimodal Large Language Models TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.505703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.505703Z digest=sha256:2269dd158e3ccc37c42fe64446dc61b35a1d7c5c58e6dcd97899e81f38f31bff

Observation 9977f2fe-3ea0-4ba3-9174-c8bdabe0dd7a · outbound

This paper cites Vision-Language Models for Vision Tasks: A Survey.

Cross-Modal Consistency in Multimodal Large Language Models Vision-Language Models for Vision Tasks: A Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.510156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.510156Z digest=sha256:0eecacafdf325f43f9058699683092ae32cd4ba0c3decfef8c8b519a18706038

Observation fb0be602-3bde-49bc-88ba-ab77ffafce5f · outbound

This paper cites Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs.

Cross-Modal Consistency in Multimodal Large Language Models Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.514494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.514494Z digest=sha256:4eaea354a00dac42eeef019b1c9592ebddef852f759439be60a9195d36e6d225

Observation f670afd0-93fd-426e-9b8b-5d241d8103cc · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 22

Resolution
verified exact
doi, observed 2026-08-12T20:54:07.561794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.519013Z digest=sha256:78425983f85b14f7dfed2affaa3a93a19f7a97f4240c60f586e5d9abf174346f

Observation 450f71d2-0fe0-41e9-b5f6-844c49a01c94 · outbound

This paper cites URL: " 'urlintro :=.

Cross-Modal Consistency in Multimodal Large Language Models URL: " 'urlintro :=

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.523015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.523015Z digest=sha256:c6e52311ce68b43101a1bb5e12e04277763c156955592ba865fc85eba623c341

Observation 7aaf04ab-ca56-4471-9cce-da84e8458829 · outbound

This paper cites write newline.

Cross-Modal Consistency in Multimodal Large Language Models write newline

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.527927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.527927Z digest=sha256:e411e872bfd723f30322da18951cd4532fbebbddfab24996e3dd67fce0ea89ec

Pith citing papers

Observation 40a8f85a-cfed-47dc-9d8f-be13d0e9ab5f · inbound

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models cites this paper.

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models Cross-Modal Consistency in Multimodal Large Language Models

Reference 111

Resolution
unresolved
no resolver link, observed 2026-08-05T16:32:43.411887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T16:32:43.411887Z digest=sha256:657ab3e9f1be7642c669ebcac5674a13c316c4a38189dcf73e668fb4c5f94435

Observation 900018fe-9fc3-49c4-9679-768acc8fb38e · inbound

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models cites this paper.

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models Cross-Modal Consistency in Multimodal Large Language Models

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-18T05:45:56.141133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-18T05:45:07.700571Z digest=sha256:0f0a4a7d15297938824522380979bb70f9e42520d29b4e18800b8d960cb527be

Observation 584f76b2-ac1e-4b35-b8d5-37780522af70 · inbound

Information-Theoretic Decomposition for Multimodal Interaction Learning cites this paper.

Information-Theoretic Decomposition for Multimodal Interaction Learning Cross-Modal Consistency in Multimodal Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-03T09:17:48.859182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-27T10:25:02.384395Z digest=sha256:76c8b60e77092d877036bbd5c7cd37b818b0f95dd7a00b51dc6da71e823bef3f

Observation 0a8925eb-0edb-4761-9cb5-c604d27d11c5 · inbound

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs cites this paper.

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs Cross-Modal Consistency in Multimodal Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T00:55:26.897977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:55:26.897977Z digest=sha256:3cecd49a8dafc962a2e0504f71c7b81a7fe08d0f4da1ef00fb7ae14275a9c401