Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T21:07:59.827793Z
Paper Citation Record · LEDGER
As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 7 inbound Pith citation observations for arXiv:2505.10917.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T21:07:59.827793Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-15T18:47:14.574922Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-06-30T18:45:00.174957Z
22 of 22 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation cd3bee83-896d-4216-8c3b-ddcd40ce3d0f · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Qwen2.5-VL Technical Report
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 342fac08-527d-41f1-9fe7-e2b424d58ddb · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Locality Alignment Improves Vision-Language Models
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 329ea386-3d6a-4592-aedb-2301564890e6 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7c7994bc-54a1-4c17-b3c2-0b80f0dc217c · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bde1c36d-28a0-4fac-b6a3-6f62240ba564 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Microsoft coco: Common objects in context
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 83052d8e-d279-41be-bdba-76e4c43e60a4 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7c04ad6c-ac6e-40ff-9420-f6372fff69c4 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d49ee1b3-6510-447e-a474-bce1d897dde8 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Reconstructive Visual Instruction Tuning
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 05891336-2efd-4c02-8940-a9f9b5a05cb3 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Accessed: 2025-01-
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 8fb35b7c-0c4d-425d-b401-c2eca526e82b · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 835875ee-adc9-4e2b-90a5-24ec269979a2 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 601caa60-7141-4474-91d3-18c64dc2e16e · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation af89c01d-7931-4292-aa51-c115dad10ff8 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Unresolved cited work
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 67fd94ee-9da5-4dbd-b54e-bf48ab174532 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 15a76928-e198-4444-8fac-33a077137e0d · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization During fine-tuning, the batch size is halved to 16 to accommodate increased model complexity and dataset scale
Reference 256
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation ab2a4859-a5e2-46f3-b4e6-b34b5d06e44d · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization A diagram is worth a dozen images
Reference 2014
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 0cf762b2-b22b-454f-ad3b-2c2397003bc1 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Kimi-VL Technical Report
Reference 2019
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1692588c-b51e-4fdc-ae1b-c2cdc1f82b46 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Multimodal Autoregressive Pre-training of Large Vision Encoders
Reference 2020
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4b1c5bce-cc5b-4b38-ae96-e1a43230aa3c · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Ocr-vqa: Visual question answering by reading text in images
Reference 2021
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 95c087a8-7383-4bad-b687-73f6fde120a9 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Referitgame: Referring to objects in photographs of natural scenes
Reference 2023
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation 3458492c-aa16-4c70-8214-bb981a6c7456 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Gramian Multimodal Representation Learning and Alignment
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9885729b-f0c2-42a1-91ad-f1aa82b1d2b3 · outbound
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization Are We on the Right Way for Evaluating Large Vision-Language Models?
Reference 2025
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1a1910c1-7522-4081-8d32-e8820e2d1460 · inbound
From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3e4f6cf0-67ff-405f-88ce-3095010eaaa4 · inbound
Fine-Grained Zero-Shot Object Detection VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 67c046c7-93fe-4e25-8faf-bfd9bf4d1412 · inbound
MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation af063bff-0d23-43a7-bdbf-c9a6ab11253d · inbound
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation c0ab3302-a89a-4ce4-8e50-5d72fee52e11 · inbound
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation daa69f7a-4758-43b6-8c68-3db61f49861e · inbound
Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.
Observation badd34c8-4d75-4c39-b6c2-9bc6af3ccad1 · inbound
MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.