{"as_of":"2026-08-17T16:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:077e852dc0500ab7953b40f8758215dfc65d28eddf1f6a79af51ef8af0551e5e","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:54:07.527927Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:32:43.411887Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:17:48.857417Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-08-05T16:32:43.411887Z","title":"Cross-modal consistency in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.411887Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:657ab3e9f1be7642c669ebcac5674a13c316c4a38189dcf73e668fb4c5f94435","observation_id":"40a8f85a-cfed-47dc-9d8f-be13d0e9ab5f","resolution":{"observed_at":"2026-08-05T16:32:43.411887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.09273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-07-03T09:17:48.857417Z","title":"Cross-modal consistency in multimodal large language mod- els.arXiv preprint arXiv:2411.09273","venue":null,"work_id":"af50f76b-8a2f-4bdb-a155-cf7e44f7bda5","year":2024},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-08-15T12:00:03.929140Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:6521ab45a7d2a6fba8b6a77cb38dc051cc460dd2103fef753e0c50693f4ae34f","observation_id":"900018fe-9fc3-49c4-9679-768acc8fb38e","resolution":{"observed_at":"2026-05-18T05:45:56.141133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.09273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-07-03T09:17:48.857417Z","title":"Cross-modal consistency in multimodal large language mod- els.arXiv preprint arXiv:2411.09273","venue":null,"work_id":"af50f76b-8a2f-4bdb-a155-cf7e44f7bda5","year":2024},"citing_paper":{"arxiv_id":"2606.11614","last_updated":"2026-06-10T03:27:13Z","snapshot_observed_at":"2026-08-12T17:35:28.374725Z","submitted_at":"2026-06-10T03:27:13Z","title":"Information-Theoretic Decomposition for Multimodal Interaction Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T10:25:02.384395Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2606.11614"},"observation_digest":"sha256:d27f8fd0f2ab0752d354cb6731404bc8dcbca56d37b9bfe491381cfa904d4d66","observation_id":"584f76b2-ac1e-4b35-b8d5-37780522af70","resolution":{"observed_at":"2026-07-03T09:17:48.859182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-08-03T00:55:26.897977Z","title":"Cross-modal consistency in multimodal large language models.arXiv preprint arXiv:2411.09273, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.897977Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:3cecd49a8dafc962a2e0504f71c7b81a7fe08d0f4da1ef00fb7ae14275a9c401","observation_id":"0a8925eb-0edb-4761-9cb5-c604d27d11c5","resolution":{"observed_at":"2026-08-03T00:55:26.897977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.09273/citation-record","integrity":"/paper/2411.09273/integrity","json":"/paper/2411.09273/citation-record.json","paper":"/paper/2411.09273"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.02071","last_updated":"2023-11-28T11:23:14Z","snapshot_observed_at":"2026-08-16T14:55:29.088594Z","submitted_at":"2023-10-03T14:13:36Z","title":"Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02071","snapshot_observed_at":"2026-08-12T20:54:07.420201Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.420201Z"},"links":{"cited_paper":"/paper/2310.02071","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:ff2066d0c2974f62a9ff73600c3fbceb654de3c68b9ed7ec9631096881406877","observation_id":"49fb75d3-f0aa-4821-8dfe-33e148385ad4","resolution":{"observed_at":"2026-08-12T20:54:07.420201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04778","last_updated":"2025-06-27T17:08:56Z","snapshot_observed_at":"2026-08-16T13:12:02.688552Z","submitted_at":"2024-10-07T06:36:55Z","title":"MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04778","snapshot_observed_at":"2026-08-12T20:54:07.425517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.425517Z"},"links":{"cited_paper":"/paper/2410.04778","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:2e58a5a5c08c854e53d48770ad1e68b6e143a3b403472b00ed7460e52c3bb9ad","observation_id":"faa740de-faa2-4496-b262-29ae9ea5a219","resolution":{"observed_at":"2026-08-12T20:54:07.425517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T20:54:07.430200Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.430200Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:b08c00fe0e91ea0b7d9fa399ed69fbfd935e9a2ab2cbb9ebdf6d0e88b698cf07","observation_id":"b3811fd5-be4e-43cc-a819-00870e45961f","resolution":{"observed_at":"2026-08-12T20:54:07.430200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T20:54:07.435149Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.435149Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:d3753494f5a878e60f411844256da3d710b7d586740859dd9664639a92e00cbf","observation_id":"742b6e9c-60a9-47cd-8b58-1032967471b7","resolution":{"observed_at":"2026-08-12T20:54:07.435149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T20:54:07.440685Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.440685Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:0107315847a9127feb988ee87f12f214b423ea5957f3d75c2482931cd88b6ef7","observation_id":"5a1cc206-3f42-45bf-90ef-eed5b2167bfa","resolution":{"observed_at":"2026-08-12T20:54:07.440685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-12T20:54:07.446103Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.446103Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:b7c7d55acc47afdd091ef452e09c1293053de8d940bd305e106e4e6d1fa98c43","observation_id":"8e622d49-26e7-4857-ba10-f8cf0bd48ac5","resolution":{"observed_at":"2026-08-12T20:54:07.446103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-16T16:15:54.684361Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-08-12T20:54:07.451241Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.451241Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:de37874d46c362f69ab676fda72279edbcb85cc5465d76164a528bf3bb0f26c8","observation_id":"ce548a52-605d-4522-a6f4-de712a00fa19","resolution":{"observed_at":"2026-08-12T20:54:07.451241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.868318Z","title":null,"venue":null,"work_id":"8cb50b1d-cce1-4c8e-bd8c-dd17dc063eac","year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.455776Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:70d4e14eb3e1c2290577c5f7f843103eb463ae0411beed1ff181776ce16d7a36","observation_id":"173395fb-7368-4c4f-b63f-80dfdb7132cc","resolution":{"observed_at":"2026-08-12T20:54:07.872469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.854727Z","title":null,"venue":null,"work_id":"17a59068-b18b-4b92-a326-45dc62d0bac7","year":2024},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.460798Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:c835c94f0d3ba03417b699824bdfa4945b33ef2ba738427f5c1dc36edce7e0dd","observation_id":"25788515-cd77-4579-a5e9-2a1afa0ef717","resolution":{"observed_at":"2026-08-12T20:54:07.858897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01201","last_updated":"2022-10-10T04:46:32Z","snapshot_observed_at":"2026-08-16T16:55:41.505356Z","submitted_at":"2022-06-02T17:59:56Z","title":"REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering","version":2},"cited_work":{"arxiv_id":"2206.01201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.01201","snapshot_observed_at":"2026-08-12T20:54:07.726034Z","title":"REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering","venue":"cs.CV","work_id":"12b77f3b-8682-4338-b547-40aaea815b47","year":2022},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.465522Z"},"links":{"cited_paper":"/paper/2206.01201","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:18dc8f404b763caab56908925fb4b64f611098b08fb21ff876fa864c030378c8","observation_id":"708ae07d-8d11-44b7-bf6f-151d4b416632","resolution":{"observed_at":"2026-08-12T20:54:07.731682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-08-16T14:42:53.337710Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-12T20:54:07.469910Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.469910Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:c59ac1ebb4c15c0ed5d94cc779fb1371eb9d141a46442e71cc6ba4b24271ce9d","observation_id":"169630e9-0429-494f-9a41-dc87ed48384c","resolution":{"observed_at":"2026-08-12T20:54:07.469910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-12T20:54:07.474475Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.474475Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:6632708eea0e5ccad05c2eece65432d4c35a831cfbb2d376769ac2f56dbba3d4","observation_id":"e5630906-671a-4101-a529-86440425b3af","resolution":{"observed_at":"2026-08-12T20:54:07.474475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05256","last_updated":"2023-11-10T18:40:44Z","snapshot_observed_at":"2026-08-16T14:44:16.973876Z","submitted_at":"2023-11-10T18:40:44Z","title":"Holistic Evaluation of GPT-4V for Biomedical Imaging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05256","snapshot_observed_at":"2026-08-12T20:54:07.478765Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.478765Z"},"links":{"cited_paper":"/paper/2312.05256","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:c72606aeeba87f77057cff9538a0d312382057aa33a1fb9cb4a32a86c0bd1f4c","observation_id":"dfad09cf-86c1-47c4-928a-d901d0ce2fb9","resolution":{"observed_at":"2026-08-12T20:54:07.478765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-12T20:54:07.483516Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.483516Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:6d9959da0f209b71b1ef6267a7beef5c53cc4231187535dcff687760497dc73e","observation_id":"71c677c3-a823-455f-8497-157ebd9d8833","resolution":{"observed_at":"2026-08-12T20:54:07.483516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16809","last_updated":"2023-10-29T10:59:21Z","snapshot_observed_at":"2026-08-16T14:48:53.868224Z","submitted_at":"2023-10-25T17:38:55Z","title":"Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16809","snapshot_observed_at":"2026-08-12T20:54:07.487795Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.487795Z"},"links":{"cited_paper":"/paper/2310.16809","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:ab7ef1a9f5b89189bc23051da50bf2851e85b909ca0ce541d4005bca53332943","observation_id":"747fecb6-0335-46e2-92d3-675deca4df85","resolution":{"observed_at":"2026-08-12T20:54:07.487795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05332","last_updated":"2023-11-28T09:47:57Z","snapshot_observed_at":"2026-08-16T14:44:40.908781Z","submitted_at":"2023-11-09T12:58:37Z","title":"On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05332","snapshot_observed_at":"2026-08-12T20:54:07.492582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.492582Z"},"links":{"cited_paper":"/paper/2311.05332","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:fc0f149b93f0dcdaec058f963725a38d03b13a7092f25c8003fabab0118ba92a","observation_id":"60417d2c-4c4c-42ff-aa95-11c697188820","resolution":{"observed_at":"2026-08-12T20:54:07.492582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09909","last_updated":"2023-12-04T14:13:35Z","snapshot_observed_at":"2026-08-16T14:51:59.767642Z","submitted_at":"2023-10-15T18:32:27Z","title":"Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09909","snapshot_observed_at":"2026-08-12T20:54:07.496787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.496787Z"},"links":{"cited_paper":"/paper/2310.09909","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:75576b6168d04b5f707cbea7a50c62af455b7fe1e2a742624faeaa92d32af14b","observation_id":"8cbd03d4-cb4a-48de-bce0-0ff089a6e322","resolution":{"observed_at":"2026-08-12T20:54:07.496787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-12T20:54:07.501393Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.501393Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:7f08672bee2dce35bd7f806f67861e18d602d1a04f39744cecf217cf940a0185","observation_id":"df4ba4a0-9376-4e86-b025-ed0616e0cbac","resolution":{"observed_at":"2026-08-12T20:54:07.501393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08821","last_updated":"2023-04-18T08:40:30Z","snapshot_observed_at":"2026-08-16T15:39:39.947245Z","submitted_at":"2023-04-18T08:40:30Z","title":"TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08821","snapshot_observed_at":"2026-08-12T20:54:07.505703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.505703Z"},"links":{"cited_paper":"/paper/2304.08821","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:2269dd158e3ccc37c42fe64446dc61b35a1d7c5c58e6dcd97899e81f38f31bff","observation_id":"a7b99f50-89af-42a4-9dd8-568a1248705d","resolution":{"observed_at":"2026-08-12T20:54:07.505703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-16T15:43:21.414777Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-12T20:54:07.510156Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.510156Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:0eecacafdf325f43f9058699683092ae32cd4ba0c3decfef8c8b519a18706038","observation_id":"9977f2fe-3ea0-4ba3-9174-c8bdabe0dd7a","resolution":{"observed_at":"2026-08-12T20:54:07.510156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16339","last_updated":"2023-10-24T04:38:52Z","snapshot_observed_at":"2026-08-16T15:30:24.219100Z","submitted_at":"2023-05-24T02:05:03Z","title":"Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16339","snapshot_observed_at":"2026-08-12T20:54:07.514494Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.514494Z"},"links":{"cited_paper":"/paper/2305.16339","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:4eaea354a00dac42eeef019b1c9592ebddef852f759439be60a9195d36e6d225","observation_id":"fb0be602-3bde-49bc-88ba-ab77ffafce5f","resolution":{"observed_at":"2026-08-12T20:54:07.514494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.eacl-main.205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.556509Z","title":null,"venue":null,"work_id":"56de35ac-b991-4055-8ac2-ee4469950f2e","year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.519013Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:f2c93904a368e4908ff642a3fdc7eca29f14ad62390ec4cb484e18f552114ef8","observation_id":"f670afd0-93fd-426e-9b8b-5d241d8103cc","resolution":{"observed_at":"2026-08-12T20:54:07.561794Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.523015Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.523015Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:c6e52311ce68b43101a1bb5e12e04277763c156955592ba865fc85eba623c341","observation_id":"450f71d2-0fe0-41e9-b5f6-844c49a01c94","resolution":{"observed_at":"2026-08-12T20:54:07.523015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.527927Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.527927Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:e411e872bfd723f30322da18951cd4532fbebbddfab24996e3dd67fce0ea89ec","observation_id":"7aaf04ab-ca56-4471-9cce-da84e8458829","resolution":{"observed_at":"2026-08-12T20:54:07.527927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T17:01:41.132950Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 4 inbound Pith citation observations for arXiv:2411.09273."}