{"as_of":"2026-08-09T21:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80a545495844a2b9a1a2d0d4c8cca11d01d67f28c0bb6d84d505b84a25aa6ce8","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:09:13.435547Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04389/citation-record","integrity":"/paper/2502.04389/integrity","json":"/paper/2502.04389/citation-record.json","paper":"/paper/2502.04389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:12.794091Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.794091Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:45685a6393b07d46617f42909df46bea17c9a4e4e071985d654c33d7017165a0","observation_id":"69974e3e-79c9-463f-91b3-905e1340c4a1","resolution":{"observed_at":"2026-08-09T04:09:12.794091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:14.279583Z","title":null,"venue":null,"work_id":"d135b752-7fc9-423e-a371-9261236ae9b3","year":2023},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.846326Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:64b12d65885a1d2c9914776357b1de1f6210f859a2ea1d3b6cd5bdbf7876b452","observation_id":"259ff82d-5221-4dc5-95be-99ba4072062f","resolution":{"observed_at":"2026-08-09T04:09:14.283426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-09T04:09:12.850665Z","title":"PaLM 2 Technical Report , September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.850665Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:c1487814966856b6f946805d09527df604670c41280daed6b812a704c300ca90","observation_id":"f04d3b80-dc59-46f7-b6fa-5b3e6379b48d","resolution":{"observed_at":"2026-08-09T04:09:12.850665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08963","last_updated":"2024-09-13T16:29:25Z","snapshot_observed_at":"2026-08-09T20:25:59.903388Z","submitted_at":"2024-09-13T16:29:25Z","title":"Safeguarding Decentralized Social Media: LLM Agents for Automating Community Rule Compliance","version":1},"cited_work":{"arxiv_id":"2409.08963","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08963","snapshot_observed_at":"2026-08-09T04:09:13.884374Z","title":"Safeguarding Decentralized Social Media: LLM Agents for Automating Community Rule Compliance","venue":"cs.CY","work_id":"609c1c78-0a69-4523-b9fd-6fc621075192","year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.854577Z"},"links":{"cited_paper":"/paper/2409.08963","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:d7b98bc8ddd4f6cc7ea8171fc90523a07899da92983c4e6914abb29b3f6d2cc6","observation_id":"01f8e264-b9a8-46d0-8995-dd93f79f24a2","resolution":{"observed_at":"2026-08-09T04:09:13.909720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:12.859116Z","title":"How far are we to GPT - 4V ? Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.859116Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:66ece9899e8909ac16868378c054d97a2ef91697f573015457079e7be730f018","observation_id":"373299ba-c648-48fb-b2d2-8624e27acd24","resolution":{"observed_at":"2026-08-09T04:09:12.859116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02545","last_updated":"2024-08-05T15:16:24Z","snapshot_observed_at":"2026-07-06T18:57:01.474525Z","submitted_at":"2024-08-05T15:16:24Z","title":"RAG Foundry: A Framework for Enhancing LLMs for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02545","snapshot_observed_at":"2026-08-09T04:09:12.862671Z","title":"RAG Foundry : A Framework for Enhancing LLMs for Retrieval Augmented Generation , August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.862671Z"},"links":{"cited_paper":"/paper/2408.02545","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:df464bced1bee3f6469e29b6ea0bdb62437e02e784c491bb8bfb179731828c54","observation_id":"a539b88b-8b20-47aa-b76c-801293357724","resolution":{"observed_at":"2026-08-09T04:09:12.862671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-09T04:09:12.871790Z","title":"VITA -1.5: Towards GPT -4o Level Real - Time Vision and Speech Interaction , January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.871790Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:c6fa2ccd18879f05393cede57d5cd80fd0994a119a01186a2837ba9d0e8b7c97","observation_id":"54c39ac3-b6c8-47a8-8297-8a833e4bf144","resolution":{"observed_at":"2026-08-09T04:09:12.871790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00193","last_updated":"2025-05-25T18:16:26Z","snapshot_observed_at":"2026-07-06T19:24:52.534713Z","submitted_at":"2024-09-30T19:45:11Z","title":"Do Vision-Language Models Really Understand Visual Language?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00193","snapshot_observed_at":"2026-08-09T04:09:12.945758Z","title":"Do Vision - Language Models Really Understand Visual Language ?, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.945758Z"},"links":{"cited_paper":"/paper/2410.00193","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:997499ac0a13d0679499071bbf835ec8f28a1c2a7a72a2a85a6e85df06c3f3bb","observation_id":"8bcc6c06-589e-4811-b439-600c4ccc9304","resolution":{"observed_at":"2026-08-09T04:09:12.945758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:14.225160Z","title":"Introducing Gemini 2.0: our new AI model for the agentic era, December 2024","venue":null,"work_id":"d4acc2bd-3d3a-48cf-a24a-aafb26524e55","year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.972338Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:9acbe8bf505907a969e0aca7f9d65570b8d2c6469c11103b579a694918e00399","observation_id":"bd4695d3-f338-45ad-9755-b8c3ef070c0c","resolution":{"observed_at":"2026-08-09T04:09:14.229040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:14.215114Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"29fe4353-435a-44fb-9c28-8bceca847433","year":2022},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.975223Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:c13c57dc44059f9c45473694e3cb600402b7be26b5fd74baff87ca81c2099aec","observation_id":"576538dc-7b39-4c28-867a-49080da2e95a","resolution":{"observed_at":"2026-08-09T04:09:14.218568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:14.163418Z","title":"ISO / IEC 29500-1:2016, 2016","venue":null,"work_id":"af5157e1-29ce-4af3-85d0-f8584f8e8c20","year":2016},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.979016Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:1ccb2a3fc6f7715bd5f6a08c79e6d2365a8c513c8f523c838e6a7cfbed2ff2e9","observation_id":"c8a2effa-a012-434d-9ae5-c944cac9172d","resolution":{"observed_at":"2026-08-09T04:09:14.208441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00947","last_updated":"2025-07-13T22:29:38Z","snapshot_observed_at":"2026-08-03T17:23:10.606578Z","submitted_at":"2024-12-01T19:46:22Z","title":"VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00947","snapshot_observed_at":"2026-08-09T04:09:12.982888Z","title":"VisOnlyQA : Large Vision Language Models Still Struggle with Visual Perception of Geometric Information , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.982888Z"},"links":{"cited_paper":"/paper/2412.00947","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:19f565853135c7cbd3df4095981f958415cd914ccf719b796921d4776c9446a1","observation_id":"99452ea1-9ee4-4289-9077-fe367dc07d56","resolution":{"observed_at":"2026-08-09T04:09:12.982888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:13.787014Z","title":"( Security ) Assertions by Large Language Models","venue":null,"work_id":"ac96c1cc-1c63-406f-a56b-0cbdd8eb4c4a","year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:12.986229Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:e54a4edb86857c09641902aeda4ebe4b1c8875f6be9ff474cc46d8cd53d54df2","observation_id":"8f7b4706-7df6-47ec-8b9a-afe353b5659c","resolution":{"observed_at":"2026-08-09T04:09:13.827055Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-05T01:31:35.222989Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-08-09T04:09:13.017075Z","title":"Fact, Fetch , and Reason : A Unified Evaluation of Retrieval - Augmented Generation , October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.017075Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:847eec676ee93096e8b5e7c373ce90404049a8efef9a37e5b325edbb05a8def0","observation_id":"d15e50ef-e078-4125-a7c7-98b07b7d8955","resolution":{"observed_at":"2026-08-09T04:09:13.017075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:14.069835Z","title":"Ferret-ui 2: Mastering universal user interface understanding across platforms, 2024","venue":null,"work_id":"c68942f7-ef75-4d34-9bb3-64ea6c036b95","year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.090674Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:691223528438352846278508a5f038a86d578f1e8a85cdf9d6d3385cd1930c2e","observation_id":"d002fb36-271c-4e91-b220-b6bdc1313401","resolution":{"observed_at":"2026-08-09T04:09:14.100640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:13.141322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.141322Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:6909e34ce66ea982aacb660d4a18550c81818627f21d1c82d7788b62e637f85b","observation_id":"5343c688-3fed-4cae-a254-edb358d51da1","resolution":{"observed_at":"2026-08-09T04:09:13.141322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-09T04:09:13.144212Z","title":"MathVista : Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts , January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.144212Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:b9c1b5bc9e84018cb12b9b0e7224c8ebbe4b3457b636cf0ce20a040615a2262a","observation_id":"c46a944f-5cdb-4f8a-b1f6-0d92fa01b048","resolution":{"observed_at":"2026-08-09T04:09:13.144212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:13.148319Z","title":"Unraveling the Truth : Do VLMs really Understand Charts ? A Deep Dive into Consistency and Robustness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.148319Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:f4f84935dca879223754c1cd623a1e3d9b9b28deba7ab48311100680bd0e245d","observation_id":"04d38526-95cd-4a30-8825-f859a2f9c39e","resolution":{"observed_at":"2026-08-09T04:09:13.148319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:09:13.152055Z","title":"GPT -4 Technical Report , March 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.152055Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:f5686e77613389ff746f60dc9b728d2323b8ec68c317d30b681937073cae4383","observation_id":"4e9a610d-cec7-4780-a594-25a95d3e5b22","resolution":{"observed_at":"2026-08-09T04:09:13.152055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-09T04:09:13.155143Z","title":"GPT -4o System Card , October 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.155143Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:9d67175d9505cf1cb41fc737bdd3dc295f187a9b10a81eccfdbef939cf67405e","observation_id":"708da264-625b-477a-b10e-33fe10f5a56d","resolution":{"observed_at":"2026-08-09T04:09:13.155143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05183","last_updated":"2024-07-09T21:16:00Z","snapshot_observed_at":"2026-08-07T13:17:07.699249Z","submitted_at":"2024-07-06T20:58:51Z","title":"FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05183","snapshot_observed_at":"2026-08-09T04:09:13.158068Z","title":"FlowLearn : Evaluating Large Vision - Language Models on Flowchart Understanding , July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.158068Z"},"links":{"cited_paper":"/paper/2407.05183","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:96367f7374ddf86dbaf38e3d8a93016c6d5c18655b3ec27a72e9949270cb0bf4","observation_id":"0d61a7b8-b479-4174-a363-d73d9d86409d","resolution":{"observed_at":"2026-08-09T04:09:13.158068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-03T13:03:43.962537Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-09T04:09:13.161806Z","title":"Vision language models are blind, July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.161806Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:0bfde9a81dbd1982ad52b4515eac28f6182356c0ab3c035d2d17a0f46dea39be","observation_id":"85364f4f-4887-461d-a6f9-59f4f65d3781","resolution":{"observed_at":"2026-08-09T04:09:13.161806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:13.165094Z","title":"FlowVQA : Mapping Multimodal Logic in Visual Question Answering with Flowcharts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.165094Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:efb4e67b28981e5b706109ae9b8316b2940405807e966cf635fc28b409d5dfd5","observation_id":"18df3a35-225f-4cf7-8ccb-bd1af4aa9f08","resolution":{"observed_at":"2026-08-09T04:09:13.165094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11729","last_updated":"2024-08-22T02:38:56Z","snapshot_observed_at":"2026-08-01T14:28:49.921929Z","submitted_at":"2024-08-21T15:54:17Z","title":"LLM4VV: Exploring LLM-as-a-Judge for Validation and Verification Testsuites","version":2},"cited_work":{"arxiv_id":"2408.11729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11729","snapshot_observed_at":"2026-08-09T04:09:13.536133Z","title":"LLM4VV: Exploring LLM-as-a-Judge for Validation and Verification Testsuites","venue":"cs.SE","work_id":"25c2cefe-c585-4502-a6e1-072bc8ef8e8d","year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.236150Z"},"links":{"cited_paper":"/paper/2408.11729","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:4cb1869a85cd46b98b911be246ec2e1dd460f5c6000bd24da4f5dd7064b1106d","observation_id":"eca1d1fa-eee1-425b-afd0-a23070db800e","resolution":{"observed_at":"2026-08-09T04:09:13.549466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02959","last_updated":"2025-02-07T08:32:24Z","snapshot_observed_at":"2026-08-03T09:17:16.115465Z","submitted_at":"2024-11-05T09:58:36Z","title":"HtmlRAG: HTML is Better Than Plain Text for Modeling Retrieved Knowledge in RAG Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02959","snapshot_observed_at":"2026-08-09T04:09:13.286082Z","title":"Htmlrag: Html is better than plain text for modeling retrieved knowledge in rag systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.286082Z"},"links":{"cited_paper":"/paper/2411.02959","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:07c6bb6bbe9e04eee3ed5af8c7889e42dc722e771c6e30e72f0fe17c236ec5b9","observation_id":"631d5d0f-34fc-46de-8529-24b46f3513f4","resolution":{"observed_at":"2026-08-09T04:09:13.286082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:14.060434Z","title":"Feighelstein, Jasmina Bogojeska, Joseph Shtok, Assaf Arbelle, Peter W","venue":null,"work_id":"1650cbe2-c2e0-42c3-8f0a-618d53d36990","year":2023},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.289923Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:f1d7f2435b0ac26480440d3d30f33a0c1a58c71dbc9246c955f6bb0ab91f4acc","observation_id":"e2f8e72e-f6ad-474f-87c8-239ff489b7a6","resolution":{"observed_at":"2026-08-09T04:09:14.064080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-09T04:09:13.292812Z","title":"LaMDA : Language Models for Dialog Applications , February 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.292812Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:b78c931c47ac7e6dd0ec66d2def1d7779987db7cd64e7d6565f4da32286025a7","observation_id":"7f6c368e-81c1-41ef-b40a-3f78581f2390","resolution":{"observed_at":"2026-08-09T04:09:13.292812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-09T04:09:13.295917Z","title":"Layoutlmv2: Multi-modal pre-training for visually-rich document understanding","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.295917Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:9cbb443c04b6f21710b45da711da396b39ae781ef25d1b56a8a897138edf8bc6","observation_id":"b14e2e0e-8f85-40ef-a7cf-0fef0c888f50","resolution":{"observed_at":"2026-08-09T04:09:13.295917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16420","last_updated":"2024-12-21T00:52:41Z","snapshot_observed_at":"2026-08-08T23:57:10.050198Z","submitted_at":"2024-12-21T00:52:41Z","title":"Beyond End-to-End VLMs: Leveraging Intermediate Text Representations for Superior Flowchart Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16420","snapshot_observed_at":"2026-08-09T04:09:13.307268Z","title":"Beyond End -to- End VLMs : Leveraging Intermediate Text Representations for Superior Flowchart Understanding , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.307268Z"},"links":{"cited_paper":"/paper/2412.16420","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:999f994d8df4fe79f1546a631311975ed077a7159f4ed2b9210617e0ee691b20","observation_id":"7206a5bf-b538-4c66-aee6-8b6a5350f007","resolution":{"observed_at":"2026-08-09T04:09:13.307268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-09T04:09:13.386647Z","title":"Ferret- UI : Grounded Mobile UI Understanding with Multimodal LLMs , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.386647Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:4b535de0005d043342f73e3506af1a9af1893c18a1bc921ec8e00cdcd6e91f5e","observation_id":"0b8e8ba3-4849-42b3-817a-bc022ce0aa3b","resolution":{"observed_at":"2026-08-09T04:09:13.386647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:09:13.984596Z","title":"MMMU : A Massive Multi -discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":null,"work_id":"236459bf-8366-4a1c-a31a-2ad14a035322","year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.431910Z"},"links":{"citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:7e080daf29495a78ce5b2811a0ec15fb8f03d031dfeaecacee390f8b8cdb3ad8","observation_id":"0f27af81-5143-40f1-bea6-3a9c2504b3b9","resolution":{"observed_at":"2026-08-09T04:09:14.054889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-09T04:09:13.435547Z","title":"MathVerse : Does Your Multi -modal LLM Truly See the Diagrams in Visual Math Problems ?, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T04:09:13.435547Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2502.04389"},"observation_digest":"sha256:6afba4cc5a7755eb4d6294d2512aa9fd3a037561ead1b4a6917a7523dbfc04b0","observation_id":"bfe125d8-adb9-4275-87c1-bfc3a8d37400","resolution":{"observed_at":"2026-08-09T04:09:13.435547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04389","last_updated":"2025-02-05T23:40:26Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T04:04:40.308291Z","submitted_at":"2025-02-05T23:40:26Z","title":"Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":6},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2502.04389."}