{"as_of":"2026-08-10T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf2f9543bf31c11c22737ae5d244f687718bed4115b52e277c319a26c84adb70","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:31:07.640675Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:30:31.136261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:30:31.307464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"cited_work":{"arxiv_id":"2507.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10787","snapshot_observed_at":"2026-08-06T16:30:31.307464Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","venue":"cs.CL","work_id":"75842fb0-7584-4f24-b8c6-d3e30f6bec84","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-10T00:17:40.727840Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.136261Z"},"links":{"cited_paper":"/paper/2507.10787","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:1c9a2420d3ab6ebced0cfd965f7f86939b9982af350e51f93bac9759e76ca243","observation_id":"ead4df80-43c5-4fa2-9cd1-94d2e2f83fb5","resolution":{"observed_at":"2026-08-06T16:30:31.315034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10787","snapshot_observed_at":"2026-08-01T15:17:47.809683Z","title":"minimally-guided meditation sessions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18514","last_updated":"2026-07-20T21:14:26Z","snapshot_observed_at":"2026-08-10T02:37:21.486442Z","submitted_at":"2026-07-20T21:14:26Z","title":"Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T15:17:47.809683Z"},"links":{"cited_paper":"/paper/2507.10787","citing_paper":"/paper/2607.18514"},"observation_digest":"sha256:1900e6e06dbea76fdc575a8a428d7d29e1ff7803ba0cb1642e2bd08a3a255c17","observation_id":"3cb0960e-baa3-40ee-8dd8-6a12d855d23e","resolution":{"observed_at":"2026-08-01T15:17:47.809683Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10787/citation-record","integrity":"/paper/2507.10787/integrity","json":"/paper/2507.10787/citation-record.json","paper":"/paper/2507.10787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:04.323749Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.323749Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5d30da48a0bf6e92ac78b5fbf0a28c6f9de3f1614bc3aae6fa3387b7481f9a7d","observation_id":"b99363ea-4eba-4f45-8a31-618e557dfc7e","resolution":{"observed_at":"2026-08-06T17:31:04.323749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:04.368718Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.368718Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:4fda89e98bd3834aaf9b00d9cfe0d6bf8e606731c0ee5c60034a4a44e44d8272","observation_id":"22b8ac64-78bb-4577-b208-90f9b3d57665","resolution":{"observed_at":"2026-08-06T17:31:04.368718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T17:31:04.449817Z","title":"Hewett, Jamie Huynh, Mojan Javaheripi, Xin Jin, Piero Kauffmann, Nikos Karampatziakis, Dongwoo Kim, Mahoud Khademi, Lev Kurilenko, James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.449817Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:14033d74c119e7197ee802df739bcc644a9113a6cb205b606280f8e64a6e06b8","observation_id":"e5a9c3f9-7ae2-427f-ad34-0a138b266a2c","resolution":{"observed_at":"2026-08-06T17:31:04.449817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T17:31:04.531326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.531326Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:90d2787db607f5ca62f7f3c0851180bdfab1ccf4b6ecd9c76d53e3a0571e2c57","observation_id":"d0c3f4d7-8bda-4bd6-81b4-977f313e3971","resolution":{"observed_at":"2026-08-06T17:31:04.531326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:04.618409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.618409Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:bf30d8fa1d7fde8873d68c15ddcf7de989fb17ee80d295364d291ac5984844b0","observation_id":"10d16190-e8fe-4758-a848-72eb3ad647f2","resolution":{"observed_at":"2026-08-06T17:31:04.618409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.118","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"e01ddd97-7b6f-4627-828e-f28bb0c88320","year":2021},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.700004Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:bf6c39cb08533b798b8649614c6c9d6424faa03ac22582a82f662cccea310420","observation_id":"8796e80b-e594-4dfc-b3ae-fb429502f2b2","resolution":{"observed_at":"2026-08-06T17:31:07.915627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-06T17:31:04.765970Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.765970Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:375f2d6079f3b1c36b19e0534b234a271cf5bccb68febd0f24233651e8a5a85a","observation_id":"c80a5182-77eb-4fdb-a94a-293e18d099f3","resolution":{"observed_at":"2026-08-06T17:31:04.765970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T17:31:04.848240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.848240Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:7a1eb82d41c241b8b717a06bdd6f32e8ad53984b5fd55182b005dc8913f0594b","observation_id":"6c9aea2e-7410-445c-bd98-77cece668d73","resolution":{"observed_at":"2026-08-06T17:31:04.848240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T17:31:04.922812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.922812Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:7d2644bdadb0238da68c6990c889508816b402d5b17321921c51cc7be7ff9a0a","observation_id":"2a2f54cb-e7dd-42e1-a323-b373eb3fdae1","resolution":{"observed_at":"2026-08-06T17:31:04.922812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T17:31:04.978209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.978209Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:626230affc99333890b930c8df0934413d307d73178ef773f2222dfa57277e72","observation_id":"eb287d19-60e0-4833-bc07-d339cb19759a","resolution":{"observed_at":"2026-08-06T17:31:04.978209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T17:31:05.069827Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.069827Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:1b26f09fbc2d9bd4997295487e4d5845297b5c0bcd043087185c5767e5759553","observation_id":"2ecd8669-a16f-498e-b133-1fe15789f6cc","resolution":{"observed_at":"2026-08-06T17:31:05.069827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.124722Z","title":"Smith, and Matt Gardner","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.124722Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:e9dd9434b81d247abaafdc6bacdd84b3ac0f0c96621661f4e1a573663fca610f","observation_id":"01f40b6c-1388-4925-935b-3c80a3c64945","resolution":{"observed_at":"2026-08-06T17:31:05.124722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.179283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.179283Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:1b7b6ed45551ee1220d512c32b57cc62f4443ab8c0183b1969b559d94ee181cf","observation_id":"ba029efd-9a29-4598-842a-ecdc1239bbfa","resolution":{"observed_at":"2026-08-06T17:31:05.179283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:31:05.239219Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.239219Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:8cb080d6bad108da1b3ae8ca7e69bf4f6c41757c02970d2fe88e72a19bfe6825","observation_id":"ae6f7e57-0837-4593-90c2-e9a1119cd005","resolution":{"observed_at":"2026-08-06T17:31:05.239219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T17:31:05.302054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.302054Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:3e8cc935d34e98adde3e6affbbe6ffac24016a45acccfaf8cf5796ffd1d68356","observation_id":"334e95ce-cf68-4d40-b4cb-ef0ce284bd34","resolution":{"observed_at":"2026-08-06T17:31:05.302054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.421247Z","title":null,"venue":null,"work_id":"8f770a21-1779-4980-a24f-875e12f26f87","year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.371769Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:51bc8d290882000d5d1584e6bf30c8d28170f846211113ad553229b4a6356fc8","observation_id":"e7f99c1a-1018-4d7b-bff9-8b28c0c992df","resolution":{"observed_at":"2026-08-06T17:31:08.425295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.406790Z","title":null,"venue":null,"work_id":"4451eb1d-d5ac-4a89-b8b2-ce0b7b00dcf5","year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.430239Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5235ad168dc5059b176a3feccb7490bd7b4444fd652499a00ef85ccd8a74bfb0","observation_id":"1d59d37e-19a2-4f80-9f12-16762b631892","resolution":{"observed_at":"2026-08-06T17:31:08.411100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.509779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.509779Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:af9da68e298104bbd75f9a70356a401d4fc5f86cac53fd2584000fd4b78ecf3b","observation_id":"b5e4b3d7-6af4-49fa-8111-1af61f880c86","resolution":{"observed_at":"2026-08-06T17:31:05.509779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.593337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.593337Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:58ce36e30ef6786c7d58adf41f8005f1758f28d13fd5684f983f2529310d30f6","observation_id":"cdb25fbd-cde1-407a-9467-8abdd9faef52","resolution":{"observed_at":"2026-08-06T17:31:05.593337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-08-10T02:42:21.966875Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-08-06T17:31:05.650761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.650761Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:cd841366abb27b7b8ac33fe8958dbcead5cfad50f9f1b328cbea81629caa7106","observation_id":"c8a5e407-34d7-4780-8eaf-88fd4a99f7d5","resolution":{"observed_at":"2026-08-06T17:31:05.650761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04903","last_updated":"2025-02-20T05:57:34Z","snapshot_observed_at":"2026-08-10T02:35:48.418436Z","submitted_at":"2024-07-06T00:40:53Z","title":"MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04903","snapshot_observed_at":"2026-08-06T17:31:05.740970Z","title":"Wilson, Woosang Lim, and William Yang Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.740970Z"},"links":{"cited_paper":"/paper/2407.04903","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:10c3d489cea02a0f1dbd92d3c4a805575492e91c33d32c37d19ec35158da6484","observation_id":"044ab6aa-2244-4981-92ce-04b773551df5","resolution":{"observed_at":"2026-08-06T17:31:05.740970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.826505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.826505Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:31197af260d7a32dcbfda643e4f4382d162eb49b00226f977827b954df0d5225","observation_id":"3eb3f74c-c218-4016-a650-a18040ae32b7","resolution":{"observed_at":"2026-08-06T17:31:05.826505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T17:31:05.896510Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.896510Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:bb604e92431ac25ecd3b31a0d3f64eb8559f79d99be5a6e2e164d3d9b8424dde","observation_id":"b24dc2c8-4c71-4aa0-9aad-a0637e9209e8","resolution":{"observed_at":"2026-08-06T17:31:05.896510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.384260Z","title":null,"venue":null,"work_id":"62315530-6f7b-44ac-8dba-e5f148f284bd","year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.964673Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:e4ca6b90e49fab3cd8c44c4d2aa94c528a26573e2fe8238245f5c8bdd878d022","observation_id":"25142980-5bc6-4eb2-b329-93ce83754834","resolution":{"observed_at":"2026-08-06T17:31:08.388176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.049930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.049930Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:cdbd27c4e463e17c938babffcdfd0bcbcecc2aaa1efe65b34e3b477689055b36","observation_id":"382fc33b-16e6-4699-aaba-acd5827d985f","resolution":{"observed_at":"2026-08-06T17:31:06.049930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.136390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.136390Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:0bd286dd24914a2680faf5e53020889ebf1c0cdfbed4ec2fec01b654af0daf5f","observation_id":"71bd2513-1153-4eab-b086-c74f2c90175a","resolution":{"observed_at":"2026-08-06T17:31:06.136390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.217193Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.217193Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:e40ea1d38a0698aec260a5be12b84b117a3e9bda931316a9043d4736f5c7d69f","observation_id":"bb40fc52-03d6-4547-9925-b7af17cad8d1","resolution":{"observed_at":"2026-08-06T17:31:06.217193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.304628Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.304628Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:610b89bd2adeb92d78c3423c64e49cad9ade5a37ddc0e67e2cffabf8e3713ba6","observation_id":"6c352d2f-aa14-4ffc-a768-154632781046","resolution":{"observed_at":"2026-08-06T17:31:06.304628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-06T17:31:06.331385Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.331385Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:674f6f317b6902b2738b4c24899b0a9d04719c28faff529b3b84915dc0206d91","observation_id":"6275a39d-90ca-4360-87a1-9d12b2d43538","resolution":{"observed_at":"2026-08-06T17:31:06.331385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.naacl-main.79","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","work_id":"c0702b84-a83b-48df-a25e-b75281258362","year":2022},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.420771Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5eb81378d653fbb8258b00f11b00eb0042764490a7ebb2fb2e0220f609e74853","observation_id":"1191d5ff-83d9-4e54-a420-914825945272","resolution":{"observed_at":"2026-08-06T17:31:07.848985Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:31:06.587372Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.587372Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:92636c1b7f45a94aac6fff917fbdf2744bdae166ad5ea3803eda6afe0fca8e29","observation_id":"da3d9eed-3254-4b24-94c5-9dc8ff57d16a","resolution":{"observed_at":"2026-08-06T17:31:06.587372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15569","last_updated":"2025-06-18T15:43:26Z","snapshot_observed_at":"2026-08-10T02:37:00.909900Z","submitted_at":"2025-06-18T15:43:26Z","title":"SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15569","snapshot_observed_at":"2026-08-06T17:31:06.719392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.719392Z"},"links":{"cited_paper":"/paper/2506.15569","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:0c1387acd9ae6748abb1050df20878c6b8408a875c8df612832d80cd2a283807","observation_id":"d7e8f31e-7830-455b-b15c-479061fff83a","resolution":{"observed_at":"2026-08-06T17:31:06.719392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:31:06.846126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.846126Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:1602113514cfb0ca350cbc59408850a2dcac17b14f9653f5a7d47e64af7c46fa","observation_id":"a08a52fe-df0c-4079-b01b-81d1fc293408","resolution":{"observed_at":"2026-08-06T17:31:06.846126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-06T23:04:27.981034Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-06T17:31:06.931509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.931509Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:f80937ea88d0290e4d7861623b35bb822e02ae138ca1e3b50e7358a4f56a03f4","observation_id":"25ae9e10-aa6b-45d5-90ff-4765489183a7","resolution":{"observed_at":"2026-08-06T17:31:06.931509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02694","last_updated":"2025-07-03T15:04:38Z","snapshot_observed_at":"2026-08-10T06:22:48.065889Z","submitted_at":"2025-07-03T15:04:38Z","title":"Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02694","snapshot_observed_at":"2026-08-06T17:31:07.060555Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.060555Z"},"links":{"cited_paper":"/paper/2507.02694","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:79270f2b1fa13acbd36b17b4ccb372a3a126f13b8a615ff65103e0298a4c7977","observation_id":"36f04ad3-bf4c-4a99-8588-f4fc60c3fc6b","resolution":{"observed_at":"2026-08-06T17:31:07.060555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-06T17:31:07.197864Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.197864Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:c3cca3266c5a5fd74caef56d6b55cf25355426a965639907e5ec51ac32070f60","observation_id":"efda6167-a745-4e83-a8d0-db77df776e65","resolution":{"observed_at":"2026-08-06T17:31:07.197864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T17:31:07.341130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.341130Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:38cfe387264b60449e4b046e8b3b8dd98b8617a77a2a23b589dbb9f9b8f1486f","observation_id":"21d1c6a6-bd64-4f82-866a-66be6cb485c1","resolution":{"observed_at":"2026-08-06T17:31:07.341130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-06T17:31:07.461658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.461658Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:78809a4860649965210c9bd8a3cdf887d8dbf33a7e7ca70f47e02dbfde3b9fbf","observation_id":"97a6cfaf-e4f6-460f-89ee-bf1172063639","resolution":{"observed_at":"2026-08-06T17:31:07.461658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.340441Z","title":null,"venue":null,"work_id":"d70eef36-ace9-441d-b175-c36a3cfab988","year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.560041Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:ad35b962b51274c51fe20305a84050b0d1f98e1c9c74a5798ad44a8d7e03bd19","observation_id":"abf220af-2417-422e-a176-c5b2eeabcc1c","resolution":{"observed_at":"2026-08-06T17:31:08.345290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:07.640675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.640675Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:4f9078cba313eded14f873e7f322a51c87d49e3dbe4aa9cb044b3b5e4dbbe478","observation_id":"39fcad47-da71-48c5-9064-ca3947aff16e","resolution":{"observed_at":"2026-08-06T17:31:07.640675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T05:33:39.208279Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2507.10787."}