{"as_of":"2026-08-19T11:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd821e3ed3f4ec0d71420c98d76edaf4c58de8b713b57a40cf3a74ee55de41f5","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:07:59.827793Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:47:14.574922Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T18:45:00.174957Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-08-15T18:47:14.574922Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18959","last_updated":"2025-07-03T17:48:36Z","snapshot_observed_at":"2026-08-17T18:07:23.051583Z","submitted_at":"2025-06-23T17:27:19Z","title":"From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T18:47:14.574922Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2506.18959"},"observation_digest":"sha256:06a17b1b177fe3a4249c70a64a85481af36b6c075b9a36a2a1fd5a6e8d35fa0f","observation_id":"1a1910c1-7522-4081-8d32-e8820e2d1460","resolution":{"observed_at":"2026-08-15T18:47:14.574922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-08-06T17:41:00.805264Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10358","last_updated":"2025-07-14T15:00:00Z","snapshot_observed_at":"2026-08-15T10:07:23.474776Z","submitted_at":"2025-07-14T15:00:00Z","title":"Fine-Grained Zero-Shot Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:41:00.805264Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2507.10358"},"observation_digest":"sha256:d75e31987e33ceadac672d90ebabf8746f97d0f26cf9cf876c0056b9aa3f5392","observation_id":"3e4f6cf0-67ff-405f-88ce-3095010eaaa4","resolution":{"observed_at":"2026-08-06T17:41:00.805264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-08-06T17:01:52.569023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12062","last_updated":"2025-07-16T09:18:18Z","snapshot_observed_at":"2026-08-17T21:34:15.122198Z","submitted_at":"2025-07-16T09:18:18Z","title":"MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:01:52.569023Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2507.12062"},"observation_digest":"sha256:efd7c7c88b5a2fa0f49dbbae244ab083fac4a8b338c607d07486aa26bfb23c49","observation_id":"67c046c7-93fe-4e25-8faf-bfd9bf4d1412","resolution":{"observed_at":"2026-08-06T17:01:52.569023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":"2505.10917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-06-30T18:45:00.174957Z","title":"Vista: Enhancing vision-text alignment in mllms via cross-modal mutual in- formation maximization.arXiv preprint arXiv:2505.10917","venue":null,"work_id":"693fbbfe-29ea-43a6-bf6e-3fb81ecb01f0","year":2025},"citing_paper":{"arxiv_id":"2605.18160","last_updated":"2026-06-02T05:15:38Z","snapshot_observed_at":"2026-08-16T17:33:34.470720Z","submitted_at":"2026-05-18T10:04:22Z","title":"Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T11:38:01.947806Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2605.18160"},"observation_digest":"sha256:d1ab8a953f6e656039568bad42bcdd9ff08f7bb11ef829e3825a320117500cc5","observation_id":"af063bff-0d23-43a7-bdbf-c9a6ab11253d","resolution":{"observed_at":"2026-05-20T11:38:14.446584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":"2505.10917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-06-30T18:45:00.174957Z","title":"Vista: Enhancing vision-text alignment in mllms via cross-modal mutual in- formation maximization.arXiv preprint arXiv:2505.10917","venue":null,"work_id":"693fbbfe-29ea-43a6-bf6e-3fb81ecb01f0","year":2025},"citing_paper":{"arxiv_id":"2605.18160","last_updated":"2026-06-02T05:15:38Z","snapshot_observed_at":"2026-08-16T17:33:34.470720Z","submitted_at":"2026-05-18T10:04:22Z","title":"Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:46.422756Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2605.18160"},"observation_digest":"sha256:6da8bd29ec4f6b1dc30c8c1c0f85617a7b475283ed02dbef3727c068e3010a7f","observation_id":"c0ab3302-a89a-4ce4-8e50-5d72fee52e11","resolution":{"observed_at":"2026-06-30T18:45:00.177236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":"2505.10917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-06-30T18:45:00.174957Z","title":"Vista: Enhancing vision-text alignment in mllms via cross-modal mutual in- formation maximization.arXiv preprint arXiv:2505.10917","venue":null,"work_id":"693fbbfe-29ea-43a6-bf6e-3fb81ecb01f0","year":2025},"citing_paper":{"arxiv_id":"2606.00959","last_updated":"2026-08-08T13:46:52Z","snapshot_observed_at":"2026-08-13T23:16:38.345689Z","submitted_at":"2026-05-31T02:29:36Z","title":"Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T17:40:30.038337Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2606.00959"},"observation_digest":"sha256:cb187163b2efef0d775a55c1b34785c81b12d4ce2497f107395a6577e9183133","observation_id":"daa69f7a-4758-43b6-8c68-3db61f49861e","resolution":{"observed_at":"2026-06-28T17:42:26.088290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"cited_work":{"arxiv_id":"2505.10917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10917","snapshot_observed_at":"2026-06-30T18:45:00.174957Z","title":"Vista: Enhancing vision-text alignment in mllms via cross-modal mutual in- formation maximization.arXiv preprint arXiv:2505.10917","venue":null,"work_id":"693fbbfe-29ea-43a6-bf6e-3fb81ecb01f0","year":2025},"citing_paper":{"arxiv_id":"2606.29462","last_updated":"2026-06-28T15:39:05Z","snapshot_observed_at":"2026-08-11T04:37:49.916455Z","submitted_at":"2026-06-28T15:39:05Z","title":"MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T07:28:52.030720Z"},"links":{"cited_paper":"/paper/2505.10917","citing_paper":"/paper/2606.29462"},"observation_digest":"sha256:5c3d439646c640e02e31d27641b1afd272e774d1fb792d2e85fffe12baff14b8","observation_id":"badd34c8-4d75-4c39-b6c2-9bc6af3ccad1","resolution":{"observed_at":"2026-06-30T07:34:21.712771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10917/citation-record","integrity":"/paper/2505.10917/integrity","json":"/paper/2505.10917/citation-record.json","paper":"/paper/2505.10917"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T21:07:59.750212Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.750212Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:d87dd564a8f59983380295d50d1984e79f33fb414c14e855c7e8764e9b2b8049","observation_id":"cd3bee83-896d-4216-8c3b-ddcd40ce3d0f","resolution":{"observed_at":"2026-08-15T21:07:59.750212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11087","last_updated":"2025-03-04T03:19:20Z","snapshot_observed_at":"2026-08-18T04:04:23.000111Z","submitted_at":"2024-10-14T21:01:01Z","title":"Locality Alignment Improves Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11087","snapshot_observed_at":"2026-08-15T21:07:59.762345Z","title":"Locality alignment improves vision- language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.762345Z"},"links":{"cited_paper":"/paper/2410.11087","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:35349d20893351fa08c29ae280a638dcce935ee1d3b0efc83ee0c930993c70d1","observation_id":"342fac08-527d-41f1-9fe7-e2b424d58ddb","resolution":{"observed_at":"2026-08-15T21:07:59.762345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T21:07:59.765372Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.765372Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:8fe7ca9517c8084aab20fa660d9b8b0efac2a3ffc5793679ad5f5a9f3b2829d6","observation_id":"329ea386-3d6a-4592-aedb-2301564890e6","resolution":{"observed_at":"2026-08-15T21:07:59.765372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-15T21:07:59.778856Z","title":"* indicates equal contribution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.778856Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:6b2e550ebeb58f2f1b616de4287d76a9ae1f10e978f6569bf387d4648bbec023","observation_id":"7c7994bc-54a1-4c17-b3c2-0b80f0dc217c","resolution":{"observed_at":"2026-08-15T21:07:59.778856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.072787Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"a84ce479-167d-4243-aaed-d011a81eff45","year":2014},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.782811Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:3da2727f82c5b8d40b51cc91caacd8da681487bb665d6142e796ebaa249a9588","observation_id":"bde1c36d-28a0-4fac-b6a3-6f62240ba564","resolution":{"observed_at":"2026-08-15T21:08:00.076558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08145","last_updated":"2025-05-31T02:59:15Z","snapshot_observed_at":"2026-08-16T13:10:36.881141Z","submitted_at":"2024-10-10T17:31:17Z","title":"Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08145","snapshot_observed_at":"2026-08-15T21:07:59.787597Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.787597Z"},"links":{"cited_paper":"/paper/2410.08145","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:aee7eb19937f3ac9a8e822e7f358988421149cdd4d46443624b5a8c7e8bc3ad1","observation_id":"83052d8e-d279-41be-bdba-76e4c43e60a4","resolution":{"observed_at":"2026-08-15T21:07:59.787597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-15T21:07:59.799314Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.799314Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:f29163f1337787606e1857a75755d9f2b35dfcb537d184cf901e04009e452d85","observation_id":"7c04ad6c-ac6e-40ff-9420-f6372fff69c4","resolution":{"observed_at":"2026-08-15T21:07:59.799314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-08-18T03:58:04.466446Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-15T21:07:59.802425Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.802425Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:e3151d0c4fc2f3d41ca6f0aae2559a3af07d031817838d53bc4bb3aae5d9b6e9","observation_id":"d49ee1b3-6510-447e-a474-bce1d897dde8","resolution":{"observed_at":"2026-08-15T21:07:59.802425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.041808Z","title":"Accessed: 2025-01-","venue":null,"work_id":"adf96a97-6969-4d05-868d-be22bcb524e9","year":2025},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.805316Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:3e8dd4a757d2bbc30147f75ab735ea19a600258e658a6e8589006e81c2f1dea2","observation_id":"05891336-2efd-4c02-8940-a9f9b5a05cb3","resolution":{"observed_at":"2026-08-15T21:08:00.047059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-15T21:07:59.813004Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.813004Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:9df4f46ac363d3bccb8d3dfac7f6e3a3f6664a0549f1b49101851b20921b32fc","observation_id":"8fb35b7c-0c4d-425d-b401-c2eca526e82b","resolution":{"observed_at":"2026-08-15T21:07:59.813004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T21:07:59.815927Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.815927Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:f429b1306b053b035911869574105653f0ee3e7e93044834746de27f3d8e1cfd","observation_id":"835875ee-adc9-4e2b-90a5-24ec269979a2","resolution":{"observed_at":"2026-08-15T21:07:59.815927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T21:07:59.819535Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.819535Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:a56f8a15213ec6b766818d6dcb4e79cf2865097371583e06b4b39c4845f9f962","observation_id":"601caa60-7141-4474-91d3-18c64dc2e16e","resolution":{"observed_at":"2026-08-15T21:07:59.819535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.022172Z","title":null,"venue":null,"work_id":"44001450-8363-4934-88d7-1dd1f494d396","year":2019},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.823432Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:d1cdb80a32336c0e0434243c86365e0a355d1079a8bd894ef6dd822ce87af86b","observation_id":"af89c01d-7931-4292-aa51-c115dad10ff8","resolution":{"observed_at":"2026-08-15T21:08:00.028481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-08-18T11:38:20.286256Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-15T21:07:59.809431Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.809431Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:b9f3955d72cf051730b2612a9f0337eafb32a6ac740ec4eb966c2e7bb2297515","observation_id":"67fd94ee-9da5-4dbd-b54e-bf48ab174532","resolution":{"observed_at":"2026-08-15T21:07:59.809431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.003276Z","title":"During fine-tuning, the batch size is halved to 16 to accommodate increased model complexity and dataset scale","venue":null,"work_id":"32239028-244e-4eda-a2df-edf76b7c112d","year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.827793Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:939ef9cdda0c0541ff96043584152d60a96f4e20460247f72d34d91c5d6885d9","observation_id":"15a76928-e198-4444-8fac-33a077137e0d","resolution":{"observed_at":"2026-08-15T21:08:00.011517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.085662Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"635f7b9a-0cf1-4829-874c-e80493513774","year":2016},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.775310Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:e7ff6447bcc7b058ae6583292ec4a49be60e62d55da8af8d780632ee2793a1dd","observation_id":"ab2a4859-a5e2-46f3-b4e6-b34b5d06e44d","resolution":{"observed_at":"2026-08-15T21:08:00.089592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-15T21:07:59.795956Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.795956Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:6f74f9b6881d85d42c1c1678d4bbff8abac035074a3464d5032cec28590d85e2","observation_id":"0cf762b2-b22b-454f-ad3b-2c2397003bc1","resolution":{"observed_at":"2026-08-15T21:07:59.795956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-19T09:37:08.990859Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-15T21:07:59.768232Z","title":"Multimodal autore- gressive pre-training of large vision encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.768232Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:f83286ca91e52df953b032a536554db66a197f48ea553cb1da63c3836f522800","observation_id":"1692588c-b51e-4fdc-ae1b-c2cdc1f82b46","resolution":{"observed_at":"2026-08-15T21:07:59.768232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.058140Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"8eabecfa-8288-4eb8-b198-6790281db10b","year":2019},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.792420Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:388273d995fb4dbfc961c333d77befdabddff7509bec288eafc263950b0234d3","observation_id":"4b1c5bce-cc5b-4b38-ae96-e1a43230aa3c","resolution":{"observed_at":"2026-08-15T21:08:00.063149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:08:00.098355Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"d5ea1758-a739-415b-9c0f-0c089b7e0bd3","year":2014},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.772019Z"},"links":{"citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:42d91e2af6e6979d8983735d8910d39d33370dc266ad89af505b7e4fbb946c9f","observation_id":"95c087a8-7383-4bad-b687-73f6fde120a9","resolution":{"observed_at":"2026-08-15T21:08:00.101799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11959","last_updated":"2025-02-12T13:25:10Z","snapshot_observed_at":"2026-08-17T15:00:45.593639Z","submitted_at":"2024-12-16T16:41:51Z","title":"Gramian Multimodal Representation Learning and Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11959","snapshot_observed_at":"2026-08-15T21:07:59.757737Z","title":"Gramian multimodal representation learning and alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.757737Z"},"links":{"cited_paper":"/paper/2412.11959","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:5ecb52011dee5e715878ab3ccdf8c59cadb0f86cba902194fd54d1a7b3549df3","observation_id":"3458492c-aa16-4c70-8214-bb981a6c7456","resolution":{"observed_at":"2026-08-15T21:07:59.757737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-15T21:07:59.753923Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.753923Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:c6d9c99716e67c5d5f7f6e6f2e035c1459992fe9287233238b4ae5e9dcf1f8f0","observation_id":"9885729b-f0c2-42a1-91ad-f1aa82b1d2b3","resolution":{"observed_at":"2026-08-15T21:07:59.753923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:58:27.298148Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 7 inbound Pith citation observations for arXiv:2505.10917."}