{"as_of":"2026-08-04T16:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0a9fcf27098d3597e864936bc332f87820c137efe95d9f903767065383dc683","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T16:45:17.022062Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:12:23.659005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-30T12:16:12.909640Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04172","snapshot_observed_at":"2026-08-01T16:12:23.659005Z","title":"2604.04172 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18091","last_updated":"2026-07-20T15:55:33Z","snapshot_observed_at":"2026-08-01T23:55:28.672150Z","submitted_at":"2026-07-20T15:55:33Z","title":"SciForma: Structure-Faithful Generation of Scientific Diagrams","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T16:12:23.659005Z"},"links":{"cited_paper":"/paper/2604.04172","citing_paper":"/paper/2607.18091"},"observation_digest":"sha256:271e74e9cfd68af7ab12c9e8980025d36be949d5f8c9bdda7e88310e49a98454","observation_id":"079c2a9e-6acc-4a07-b591-945fb24f61b2","resolution":{"observed_at":"2026-08-01T16:12:23.659005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04172","snapshot_observed_at":"2026-07-30T12:14:15.738599Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27066","last_updated":"2026-07-29T15:54:14Z","snapshot_observed_at":"2026-08-02T20:23:45.400141Z","submitted_at":"2026-07-29T15:54:14Z","title":"SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-30T12:14:15.738599Z"},"links":{"cited_paper":"/paper/2604.04172","citing_paper":"/paper/2607.27066"},"observation_digest":"sha256:8a05cb8e91307b570fd3a701fc00b6fc881cb8d229c348a660c54b77bd7a0201","observation_id":"87fa53f8-e43c-4cdb-ae0d-e5e9fbe6fa81","resolution":{"observed_at":"2026-07-30T12:14:15.738599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2604.04172","doi":"10.48550/arxiv.2604.04172","metadata_source":"pith","pith_arxiv_id":"2604.04172","snapshot_observed_at":"2026-07-30T12:16:12.909640Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","venue":"cs.CV","work_id":"08f9841d-4147-4072-81ae-ff4360ee90c7","year":2026},"citing_paper":{"arxiv_id":"2607.27084","last_updated":"2026-07-29T16:07:44Z","snapshot_observed_at":"2026-08-02T19:22:42.901203Z","submitted_at":"2026-07-29T16:07:44Z","title":"SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-30T11:37:27.095506Z"},"links":{"cited_paper":"/paper/2604.04172","citing_paper":"/paper/2607.27084"},"observation_digest":"sha256:1bd52f5081255600207636338cd8ceb8a40e7fd5ff2d9bfc0e72dcb8449ea8a9","observation_id":"39b48dcb-1e7a-4f9f-9980-a454bbd1f682","resolution":{"observed_at":"2026-07-30T11:41:21.736732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.04172/citation-record","integrity":"/paper/2604.04172/integrity","json":"/paper/2604.04172/citation-record.json","paper":"/paper/2604.04172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ec9b45a-a643-4af1-bf51-e112f919154c","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:912c0f57f8aeac4f94a91c18f306885defe5a1fc2ea17881d92900c92ab624fd","observation_id":"3aad4050-c983-46f0-9cdb-2582f8018c3e","resolution":{"observed_at":"2026-05-14T05:58:14.872301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22126","last_updated":"2025-05-28T08:51:01Z","snapshot_observed_at":"2026-07-06T21:32:04.296403Z","submitted_at":"2025-05-28T08:51:01Z","title":"SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model","version":1},"cited_work":{"arxiv_id":"2505.22126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22126","snapshot_observed_at":"2026-07-02T11:46:55.839322Z","title":"Kevin Zhou, and Kaipeng Zhang","venue":null,"work_id":"43e02442-5122-48a1-be81-16fc71c72268","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2505.22126","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:ea939ae16ef352eb9903c9806491784e9ec69b9c842e152a27500019169169aa","observation_id":"29923d39-5047-4c56-a629-c4fddb464879","resolution":{"observed_at":"2026-05-13T16:48:03.127435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02850","last_updated":"2019-06-07T00:54:53Z","snapshot_observed_at":"2026-07-06T07:58:36.769011Z","submitted_at":"2019-06-07T00:54:53Z","title":"Figure Captioning with Reasoning and Sequence-Level Training","version":1},"cited_work":{"arxiv_id":"1906.02850","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02850","snapshot_observed_at":"2026-06-30T16:14:53.334933Z","title":"Figure Captioning with Reasoning and Sequence-Level Training","venue":"cs.CV","work_id":"ae960383-ec22-4612-960a-6cd13c80f9cb","year":2019},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/1906.02850","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:21cf178182e2260bb1d02d20185cce606c2df7edd0d490427989c9159bd01bec","observation_id":"637a6ca9-398d-4514-b9a2-aa414119ae6e","resolution":{"observed_at":"2026-05-13T16:48:03.153640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbbb119a-820b-4645-8e82-422123e764fe","year":2020},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:eb037e0e6a27dc3450c739e6116ade4e99e3d61b2843fa07e1472fbfc2e70d33","observation_id":"3c45bc01-ce71-4cf9-90a9-a5378ebe2afe","resolution":{"observed_at":"2026-05-14T05:58:14.856423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05134","last_updated":"2024-01-02T21:18:48Z","snapshot_observed_at":"2026-07-06T15:52:32.458556Z","submitted_at":"2023-07-11T09:23:05Z","title":"TIAM -- A Metric for Evaluating Alignment in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2307.05134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.05134","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4538bf4f-7614-4922-bced-4456d07cb8ee","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2307.05134","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:cc2c01aad6f83cc1455bf36a4b051bca135adebceff9b3246a3828dfddd81170","observation_id":"4906e079-76c2-4fdb-bc59-428e16635311","resolution":{"observed_at":"2026-05-13T16:48:03.134881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e97dcc8-54a0-4c9b-9722-44d185d709ab","year":2020},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:8ad3b73e551c9a44a1d2b3d0ef48676fc62cac6ee0ce7dd497d03dd0a5657cc4","observation_id":"9ac896bd-787d-49b9-8aa1-0384152d2871","resolution":{"observed_at":"2026-05-14T05:58:14.853550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11624","last_updated":"2021-10-25T04:37:30Z","snapshot_observed_at":"2026-07-06T12:00:35.868258Z","submitted_at":"2021-10-22T07:10:41Z","title":"SciCap: Generating Captions for Scientific Figures","version":2},"cited_work":{"arxiv_id":"2110.11624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.11624","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lee Giles, and Ting-Hao 'Kenneth' Huang","venue":null,"work_id":"82d87897-c2ab-4e8b-b33f-59fc10ce7f4f","year":2021},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2110.11624","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:26c2c594521f6d2f962646f2d74325742d8338b2a1f208d4052e665719d76e47","observation_id":"aa87a366-a820-4db3-9be1-bdd36d720a5b","resolution":{"observed_at":"2026-05-13T16:48:03.157019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18248","last_updated":"2024-01-09T12:07:02Z","snapshot_observed_at":"2026-07-06T16:54:49.541291Z","submitted_at":"2023-11-30T04:43:26Z","title":"mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2311.18248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-paperowl: Scientific diagram analysis with the multimodal large language model","venue":null,"work_id":"a6bd674a-2faa-4e10-80b4-9b6a60880d3a","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2311.18248","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a6afe613f86d12b865a5a006ba23df6d1e4051897cfc5f0e60c6ac07fc3f7ce2","observation_id":"1a8df55f-d682-43a3-9150-19411977c5c1","resolution":{"observed_at":"2026-05-13T16:48:03.131525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:ba484643c72f4c2a8df572e75a894cc35e77f6dc690ad2c966c9c47e4dcf2337","observation_id":"1a663a3f-b1ac-4b2e-aa3d-8ca67ed77482","resolution":{"observed_at":"2026-05-13T16:48:03.142195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"91e8064f-5ea8-4162-83fb-79711f659570","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:67818ce0b8cab16e7dec609b4f0a76ea3a73ad8ff029f576883f08dd7a1749d9","observation_id":"6ea16a10-3e8f-4df2-98b2-5816654ae642","resolution":{"observed_at":"2026-05-14T05:58:14.859100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08163","last_updated":"2018-03-29T17:42:15Z","snapshot_observed_at":"2026-07-06T06:20:08.332666Z","submitted_at":"2018-01-24T19:47:04Z","title":"DVQA: Understanding Data Visualizations via Question Answering","version":2},"cited_work":{"arxiv_id":"1801.08163","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.08163","snapshot_observed_at":"2026-06-29T13:33:28.154174Z","title":"DVQA: Understanding Data Visualizations via Question Answering","venue":"cs.CV","work_id":"ba6e6b4b-f25c-4f15-97c2-eacce3bc7aef","year":2018},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/1801.08163","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:4858918d01271e1a0b2107dfe04c4e675e1f8447949b5a0727bc764addfbc391","observation_id":"f9e1b439-4b0a-440e-8fe7-509dc4e9a0e0","resolution":{"observed_at":"2026-05-13T16:48:03.145919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":"1710.07300","doi":"10.48550/arxiv.1710.07300","metadata_source":"pith","pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","venue":"cs.CV","work_id":"aa4d846d-b19b-47d6-b5c3-1f61acf0a6a0","year":2017},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:4cfc65d0c55e0cf9666d5ff87385e027438ba59ee1b2358d6146e5dd6088f9be","observation_id":"57e0cd0d-85d4-4dc5-8cb7-eb0fa457a6e5","resolution":{"observed_at":"2026-05-13T16:48:03.120684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b8fadf54-9f06-4f5e-baf4-e4fd3790d440","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:3f2b599feccd24d5fc980488ec3f5b5e9b78b83c61688cd51d2fde38ab871025","observation_id":"36d86ebd-6a76-4eb8-bf23-5d56f63093bb","resolution":{"observed_at":"2026-05-14T05:58:14.894565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.00231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-07-03T20:48:56.198380Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":"4af8a742-b9ce-48eb-99e6-35eb96332561","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a34d9db18078285e3913dee62a8032a0a962cf0f26b6b01ae68071ade6bdb8f2","observation_id":"5ab9584a-fef9-4d1f-ba7b-4957d8e3abe5","resolution":{"observed_at":"2026-05-13T16:48:03.177074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04903","last_updated":"2025-02-20T05:57:34Z","snapshot_observed_at":"2026-07-06T18:42:14.020553Z","submitted_at":"2024-07-06T00:40:53Z","title":"MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding","version":3},"cited_work":{"arxiv_id":"2407.04903","doi":"10.48550/arxiv.2407.04903","metadata_source":"pith","pith_arxiv_id":"2407.04903","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Wilson, Woosang Lim, and William Yang Wang","venue":"cs.CL","work_id":"c3fad474-8ba8-487e-8bbb-d493d804b738","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2407.04903","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:cf16912034dd5f185fd6b987db09dccc5b4e306e91e6c75ae94fe17613ee9b73","observation_id":"4241a15d-582b-4c18-aafa-a8dd0b191c77","resolution":{"observed_at":"2026-05-13T16:48:03.187477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15997","last_updated":"2024-07-03T05:21:02Z","snapshot_observed_at":"2026-07-06T17:08:04.891015Z","submitted_at":"2023-12-26T11:01:36Z","title":"Aligning Large Language Models with Human Preferences through Representation Engineering","version":3},"cited_work":{"arxiv_id":"2312.15997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15997","snapshot_observed_at":"2026-07-02T02:06:27.143564Z","title":"Aligning large language models with human preferences through representation engineering","venue":null,"work_id":"5e4d0410-875d-4941-8f20-e4cf0c3829fb","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2312.15997","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:c498576dc0af5086a5889496f156a3dd87528a05a5a5b8a29a3e00d43a1bf197","observation_id":"728949d0-95c7-4b12-8945-2e66611f446e","resolution":{"observed_at":"2026-05-13T16:48:03.173387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0c92a2d0-e051-443c-8b13-160a3342d276","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:7fdc6601ac943fbf76e2b7506f16cd87ffce6d610462b4d53eca8cfe3f761cf2","observation_id":"a68b9895-21cb-4fc4-bbda-60bd4415c2d0","resolution":{"observed_at":"2026-05-14T05:58:14.889617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f7cf6dc-c5a5-438b-8a64-83a68a8fa1f8","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a9cb0228ef4e1d609d295880aa6ddc3d6dc5a78a937f1340111d7dd350f182da","observation_id":"c1c364f7-8a10-4067-b9ba-964d218cacd4","resolution":{"observed_at":"2026-05-14T05:58:14.904571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:850390e6a7bff2160c882e7b4d73f0588260da1a5faea862bb6ddc631786145c","observation_id":"bd49d785-8948-4577-a935-5beb3f527ee1","resolution":{"observed_at":"2026-05-13T16:48:03.160299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:e4a4a916eb4321aa1cfd7ff766243fe03d3b46e15cc7336d330f05e57baf5248","observation_id":"f1cfd909-86c2-4065-8e3c-e448d9621a5c","resolution":{"observed_at":"2026-05-13T16:48:03.169996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07847894-fc69-4732-9007-1013f7898f79","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:b002d757faeb1175dc7cf4fd2da515ce6883330ae07e1a7ecaf21fe182d7b9e7","observation_id":"8d6ccf26-197f-4b07-a06d-602920319e59","resolution":{"observed_at":"2026-05-14T05:58:14.902116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0e27ab7-a8eb-4f0b-8576-c409c40950c8","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a178bfb53101ed91bf3668b979fa5674fd57835bcb94644be5c3f74119702c18","observation_id":"670a2808-f012-4078-851e-45ada37ec5d8","resolution":{"observed_at":"2026-05-14T05:58:14.897160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"71848786-c32e-4780-8ed6-9c5f0e314254","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:bb3d32008487aec64b3d909699f789fa5ddaf03138bb0bdb8d58b85287154bd2","observation_id":"ffe3a154-5aaf-4027-80b5-847567de1cfd","resolution":{"observed_at":"2026-05-14T05:58:14.899686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08807","last_updated":"2024-12-05T17:52:49Z","snapshot_observed_at":"2026-07-31T04:21:45.523568Z","submitted_at":"2024-05-14T17:54:17Z","title":"SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation","version":2},"cited_work":{"arxiv_id":"2405.08807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08807","snapshot_observed_at":"2026-07-02T12:26:56.360033Z","title":"arXiv preprint arXiv:2405.08807 , year=","venue":null,"work_id":"b09aef61-37b9-4692-893f-7d979ff10ae1","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2405.08807","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:0cf66fc7b652fa5d76d97681d56331983b772b6b57da746f99ac4ca93e298b35","observation_id":"6a1702af-bec8-460d-b80e-41888bc8672b","resolution":{"observed_at":"2026-05-13T16:48:03.163678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11556","last_updated":"2025-05-31T14:41:26Z","snapshot_observed_at":"2026-08-04T11:08:34.470899Z","submitted_at":"2023-12-17T08:07:32Z","title":"StarVector: Generating Scalable Vector Graphics Code from Images and Text","version":4},"cited_work":{"arxiv_id":"2312.11556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11556","snapshot_observed_at":"2026-06-30T13:54:43.813926Z","title":"Starvector: Generating scalable vector graphics code from images","venue":null,"work_id":"db6e9d70-04e5-49a6-ab05-2a102712f4d1","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2312.11556","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:3c0ee4e2e4383c93e586717d0ef1f42a0ceef3f9caa021cd695f2fdb2277ff0b","observation_id":"99457d57-9e9b-488e-9493-2aa71d9cee3b","resolution":{"observed_at":"2026-05-13T16:48:03.166902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11248","last_updated":"2022-10-21T18:32:27Z","snapshot_observed_at":"2026-07-06T14:08:14.508004Z","submitted_at":"2022-10-19T16:37:48Z","title":"OCR-VQGAN: Taming Text-within-Image Generation","version":2},"cited_work":{"arxiv_id":"2210.11248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.11248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rodriguez, David Vazquez, Issam Laradji, Marco Pedersoli, and Pau Rodriguez","venue":null,"work_id":"d193b395-c5c9-4dd4-9d3a-3ab19e18c996","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2210.11248","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:91273f1bb85d6063e2fbc876ab77ea61bab949bf8f33e79a7070cd4d319a1105","observation_id":"87f3003e-6cf7-43a5-9a1f-829d500ca49d","resolution":{"observed_at":"2026-05-13T16:48:03.180740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00800","last_updated":"2023-12-17T08:24:37Z","snapshot_observed_at":"2026-08-04T16:01:05.204801Z","submitted_at":"2023-06-01T15:28:41Z","title":"FigGen: Text to Scientific Figure Generation","version":3},"cited_work":{"arxiv_id":"2306.00800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.00800","snapshot_observed_at":"2026-07-04T16:39:58.010484Z","title":"Rodríguez, David Vázquez, Issam H","venue":null,"work_id":"e56d61e7-c6d9-4d43-a83c-04ce8fae95f3","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2306.00800","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:917a605f038c076919cf54dd3109a6777fdc8bef14e37af2f69c127c6c878e68","observation_id":"a2666c8e-65e4-4d7e-bc8c-bf595c51b326","resolution":{"observed_at":"2026-05-13T16:48:03.184022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:10:46.144703Z","title":null,"venue":null,"work_id":"5a4c80e0-3a6e-41cb-a841-d81932d46635","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:6ab4c8e5a295fe93d30e2b5911088c29235e1e684f8aef5a28d6bfd5975f34a6","observation_id":"8fcb09b1-f074-4784-a7d7-675820ef6211","resolution":{"observed_at":"2026-05-14T05:58:14.891982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:99ab30039975e724120584d5b528f9a5aee5fa265096712edac9a7986887681c","observation_id":"77b4005e-1dd4-46f5-b1b1-8be724f3edf7","resolution":{"observed_at":"2026-05-13T16:48:03.149583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"257c416a-d221-43b9-ade2-e4856f8d19ad","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:0443caadc2bb80c60267e0fd43413cdcd072d5ccd168c77385fe01d5114469fa","observation_id":"a725aeec-e143-4fca-a19f-070a6fa01b0b","resolution":{"observed_at":"2026-05-14T05:58:14.867052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"032e4deb-ff2e-4c5e-8702-ccd51e9aba78","year":2016},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:59256709a1bf483fbcca520ad4504cffa72ca8c26c5a8f8909f506f0913faf50","observation_id":"8aeb5649-b9f0-406c-a534-cf6ff8eb1f1b","resolution":{"observed_at":"2026-05-14T05:58:14.861534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be97f597-9cd2-4192-98bd-eacd600627d2","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:0810a08b8fae5dc7b7e0ac16d56a07894acd8a7cd17591eac874ce0a12c21a2e","observation_id":"841567f4-5b03-4a87-a5bf-e8314b9bf0e4","resolution":{"observed_at":"2026-05-14T05:58:14.884429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a8858b0-67d0-4759-b382-3a5c3d0967ed","year":2015},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:75179129057c9a1ae8693ca2fb81d8b9b2b25b638ec30c5f16c851be7f008a01","observation_id":"a2252e7b-776c-41c1-a6b9-0db6ed906358","resolution":{"observed_at":"2026-05-14T05:58:14.875150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2406.18521","doi":"10.48550/arxiv.2406.18521","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"c9b18bcb-4462-48c9-be76-491ad33d4809","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:15ddcf5e418cdeec60bf5214bbab99c255119ed226178456b04234de7bba9f61","observation_id":"6d1625b7-d971-470e-97a3-00b0d46a3d21","resolution":{"observed_at":"2026-05-13T16:48:03.138494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad362c25-0f39-4695-adab-7b2d120cdcb6","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:ce32364e943c9db7490ffcc3750270dc575152a60a1694cd31a7e6c8769b7086","observation_id":"e977d784-24ad-476a-aef0-f7058ec1b1fd","resolution":{"observed_at":"2026-05-14T05:58:14.887186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5335c57a-44fb-409b-abdf-242244c2032f","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:eb4f0a23cc9d48ba8a22531324ce8250d2397c07072f5e479bfdcba6cd7cca4c","observation_id":"2098109e-c795-4eb8-a2f0-e990eeeb7b7c","resolution":{"observed_at":"2026-05-14T05:58:14.869763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03491","last_updated":"2023-06-06T08:16:16Z","snapshot_observed_at":"2026-08-03T16:03:33.326810Z","submitted_at":"2023-06-06T08:16:16Z","title":"SciCap+: A Knowledge Augmented Dataset to Study the Challenges of Scientific Figure Captioning","version":1},"cited_work":{"arxiv_id":"2306.03491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03491","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9b7cc20-5c25-4d22-81f1-0d0c3e87d8e5","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2306.03491","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:4ef5cd470350edb7289b168e265c0333f2929b26dedef79c1286b0ea9cbbd248","observation_id":"73f37f0d-40e9-4022-b32b-978c601e84b5","resolution":{"observed_at":"2026-05-13T16:48:03.123892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2de0083e-afc3-4c26-915a-298ca79ccb79","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:6fee593dc2d744618ad2a0a7f197542a34f74b23389b4d424932880b5809debc","observation_id":"0b982cf7-55e5-4ecf-82bd-c1a2c83e607e","resolution":{"observed_at":"2026-05-14T05:58:14.864256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0141ebc1-dfa2-40ce-85d4-00bd41b5acc7","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:25b5c35ce944a237b56603802bbcc6b35aa052b2f4fcfb6d79fdee66857f9db6","observation_id":"d9f239f0-318a-4107-9de3-8ec44bafc90b","resolution":{"observed_at":"2026-05-14T05:58:14.877915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.23265","doi":"10.48550/arxiv.2601.23265","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"You are an expert on translating academic writing to visual specification","venue":null,"work_id":"020b32b3-5122-41a2-b48d-a6492ea7b850","year":2026},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:50e92443924f8f9d7e1231bf7f4559e1070557ef2dd96c88c66c5ce3740001e9","observation_id":"83ad4aca-ed07-4ca4-be35-c520170bfa20","resolution":{"observed_at":"2026-05-13T16:48:03.115963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.044126Z","title":"Autoﬁgure: Generating and reﬁning publication-ready scientiﬁc illustrations","venue":null,"work_id":"5a2a44a6-6889-42aa-ab9b-34d8c7e30821","year":2026},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:5d19b3b9e7b1e3b9de143f1de54966c029d8ea202ade59feca59a3832c01caa3","observation_id":"2487533b-bfc4-4ebc-8995-757631700859","resolution":{"observed_at":"2026-05-13T16:48:03.111073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.938856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"38c07273-5071-4bbb-b2af-067af11becc7","year":null},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a32968b4a3fd7e7ae0cf2aa5bff25f07d9935105e7d4470c81ecf9b0cd6cb0bf","observation_id":"aaddee79-f288-4f75-8b22-6b81650df147","resolution":{"observed_at":"2026-05-14T05:58:14.881515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:afea4628cdc5535ad28ed82c8014031784f24e62fd1644ceffe9989aac1b41e0","observation_id":"f235db4d-e6cf-4d13-9104-83fca1482a0d","resolution":{"observed_at":"2026-05-14T05:58:14.850483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":21,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2604.04172."}