{"as_of":"2026-08-13T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81a980d7ea602d9b159f62f8a24f6c4bcc9f378a1ce1249abb5f156667b14e1a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:59:02.118521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":46,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-08-13T20:16:41.272728Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T19:40:13.816153Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2401.01614"},"observation_digest":"sha256:0c0f122478f9923635117e215142c3b944fe304c6467b0e601ebefa4339bcbf3","observation_id":"82f926bb-30c7-4d22-ab49-736293420864","resolution":{"observed_at":"2026-05-15T19:40:13.936441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-12T18:02:58.527813Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T09:29:27.173784Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2410.23218"},"observation_digest":"sha256:10e3cf00e0026fa42943a7554d7dbad27ff167dff541b5a60c82a70381f66e8a","observation_id":"20fee837-c177-47bd-9c3c-bce890a6f26e","resolution":{"observed_at":"2026-05-13T09:29:27.731687Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-11T05:14:27.818364Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17787","last_updated":"2024-12-23T18:48:04Z","snapshot_observed_at":"2026-08-12T21:00:19.974388Z","submitted_at":"2024-12-23T18:48:04Z","title":"Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:14:27.818364Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2412.17787"},"observation_digest":"sha256:2f256569057d6d7c9198124ee74be7430bfb78f68dde5af8bb3064b7e52645a8","observation_id":"906b7d0b-3b79-4991-82bc-aee6a1aaf401","resolution":{"observed_at":"2026-08-11T05:14:27.818364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-11T14:59:02.118521Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-13T14:56:43.704817Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:02.118521Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:8dbb34dd8aeb6730dac8eed42bb481dd03994d2c8fecae5809c3e25d768219e3","observation_id":"77827c3d-3760-42be-b18b-06509bbe4f35","resolution":{"observed_at":"2026-08-11T14:59:02.118521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-10T22:17:27.721321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.721321Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:5e8b1692e0935c62392dd0472b1106eb1fb3a1a62dd97280e797aad9304d9622","observation_id":"d343a2fb-2145-4c82-ab37-cec424bc1cec","resolution":{"observed_at":"2026-08-10T22:17:27.721321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-10T21:30:50.183976Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04675","last_updated":"2025-01-08T18:33:17Z","snapshot_observed_at":"2026-08-11T01:37:28.672605Z","submitted_at":"2025-01-08T18:33:17Z","title":"Enhancing Financial VQA in Vision Language Models using Intermediate Structured Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:50.183976Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2501.04675"},"observation_digest":"sha256:2ec3aeb6849418bdca8044dd9ffd3e68835772c0d59eaf01d303ebc870efc7d9","observation_id":"a97f4161-3543-47fd-b634-f125db8ec85d","resolution":{"observed_at":"2026-08-10T21:30:50.183976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-10T16:34:40.353475Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13042","last_updated":"2025-02-25T16:41:36Z","snapshot_observed_at":"2026-08-12T15:01:39.356684Z","submitted_at":"2025-01-22T17:44:01Z","title":"Does Table Source Matter? Benchmarking and Improving Multimodal Scientific Table Understanding and Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T16:34:40.353475Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2501.13042"},"observation_digest":"sha256:e86981685c9ddea0ac8e75f7b0280a99044c4cc01ffaac174b20221734400a97","observation_id":"8ab3fd26-ed02-41c2-8760-fa99c7fade3e","resolution":{"observed_at":"2026-08-10T16:34:40.353475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-07T11:03:59.387453Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03665","last_updated":"2025-06-04T07:56:13Z","snapshot_observed_at":"2026-08-13T05:00:05.297440Z","submitted_at":"2025-06-04T07:56:13Z","title":"ROSA: Addressing text understanding challenges in photographs via ROtated SAmpling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:03:59.387453Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2506.03665"},"observation_digest":"sha256:258ab792ee86231506b4cc9266221ab38b95df73b212ccc21f998bb267f0b657","observation_id":"3c85f384-4edd-41bf-8534-18187f05fe2a","resolution":{"observed_at":"2026-08-07T11:03:59.387453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-07T10:27:36.762356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05182","last_updated":"2025-08-20T20:52:35Z","snapshot_observed_at":"2026-08-08T14:59:33.448999Z","submitted_at":"2025-06-05T15:52:44Z","title":"On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:27:36.762356Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2506.05182"},"observation_digest":"sha256:bbd837faf4ba23badc04ee23612a60d5f0fca6da159c1e0cfdf03070690de849","observation_id":"fed8b3d8-09b9-48a8-beeb-74bfe88388d9","resolution":{"observed_at":"2026-08-07T10:27:36.762356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T05:46:40.906386Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Under- standing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05394","last_updated":"2025-09-05T11:13:40Z","snapshot_observed_at":"2026-08-08T08:01:19.175199Z","submitted_at":"2025-09-05T11:13:40Z","title":"Reverse Browser: Vector-Image-to-Code Generator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:46:40.906386Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2509.05394"},"observation_digest":"sha256:9a3aa2fce7382d720ec009ad664892831931b6b8d94059c9273e3c50ff3ce5d6","observation_id":"9882f442-de08-46bf-b6d3-00bd7f5cee3c","resolution":{"observed_at":"2026-08-05T05:46:40.906386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2602.01785","last_updated":"2026-04-28T16:05:53Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T08:10:21Z","title":"CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T08:30:50.984873Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2602.01785"},"observation_digest":"sha256:21c0101a9dd1c069e25eca13007ce95be532aead06ec07870f6324c51e3ea0d1","observation_id":"d21f2ba5-2268-4a35-94c3-47002be82ff8","resolution":{"observed_at":"2026-05-16T08:32:36.520554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-04T06:07:00.634725Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.10880","last_updated":"2026-08-03T17:34:50Z","snapshot_observed_at":"2026-08-13T11:59:21.428613Z","submitted_at":"2026-02-11T14:08:06Z","title":"Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:00.634725Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2602.10880"},"observation_digest":"sha256:38afa0f14ba280fc720190ba9201fdcccbb31daa73cc3f9ea5bd46651b4de1fa","observation_id":"c2638527-bb42-4cbc-a2ef-8b36c9c55188","resolution":{"observed_at":"2026-08-04T06:07:00.634725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2602.13232","last_updated":"2026-01-29T06:08:19Z","snapshot_observed_at":"2026-08-11T00:32:18.845798Z","submitted_at":"2026-01-29T06:08:19Z","title":"PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T10:24:58.444855Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2602.13232"},"observation_digest":"sha256:a726a8d3f59ef43b3e81e2ca8b5204caf541fd30ed2bc43b98d7baa8527b9849","observation_id":"785fbaf9-8a17-4fb1-984c-a15bf4f060b2","resolution":{"observed_at":"2026-05-16T10:27:44.691324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2604.16504","last_updated":"2026-04-14T17:45:22Z","snapshot_observed_at":"2026-08-11T16:46:09.620310Z","submitted_at":"2026-04-14T17:45:22Z","title":"From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:08:30.056580Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2604.16504"},"observation_digest":"sha256:da745bb50f06cebeb03678bfb2705fa6dbbce28fda28ec3fc6affff046faeed1","observation_id":"d983b81e-7374-4113-ab0c-d9e68e9686e9","resolution":{"observed_at":"2026-05-11T09:16:02.598794Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2605.17656","last_updated":"2026-05-17T21:14:32Z","snapshot_observed_at":"2026-08-13T08:49:39.126348Z","submitted_at":"2026-05-17T21:14:32Z","title":"MUIAnno: An Expert-Annotated Dataset and Evaluation Benchmark for Mobile UI Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T22:08:27.511727Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2605.17656"},"observation_digest":"sha256:995d00ac9588fce94afd911e7e43d8f9cfff883b62d93ca4cc702da30fb56f7a","observation_id":"2def160d-64ec-4783-92bd-705abfe97061","resolution":{"observed_at":"2026-05-19T22:12:50.405139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2606.03879","last_updated":"2026-06-02T16:46:42Z","snapshot_observed_at":"2026-08-07T17:02:56.856514Z","submitted_at":"2026-06-02T16:46:42Z","title":"Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T11:08:36.451147Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2606.03879"},"observation_digest":"sha256:5a613943f17fc6ef84d5134db6c6ab61e770b80c4fca473c09facb014b894fe9","observation_id":"62eb262e-d044-4415-a72b-dd82e034a00c","resolution":{"observed_at":"2026-07-02T02:16:26.462736Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":"2210.03347","doi":"10.48550/arxiv.2210.03347","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , publisher =","venue":"arXiv (Cornell University)","work_id":"f97c8c47-90d5-4d17-9b14-fafec05d6647","year":2023},"citing_paper":{"arxiv_id":"2606.10334","last_updated":"2026-06-09T02:28:39Z","snapshot_observed_at":"2026-08-02T23:27:16.777810Z","submitted_at":"2026-06-09T02:28:39Z","title":"Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:42:21.520627Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2606.10334"},"observation_digest":"sha256:a23e9e6e34169fb4c69a05bef71f7ebe534d915887a8a0b27ebbd4e960ed7214","observation_id":"58987a42-728b-49c5-91d1-0625abc55cec","resolution":{"observed_at":"2026-07-03T04:47:37.746354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.067123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-07-14T09:13:07.507164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10796","last_updated":"2026-07-12T15:09:03Z","snapshot_observed_at":"2026-08-13T02:07:42.889424Z","submitted_at":"2026-07-12T15:09:03Z","title":"Mixture of Cognitive Experts in Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T09:13:07.507164Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2607.10796"},"observation_digest":"sha256:b530ad430746cbcad676c0c51bbeb529477f3fd4969a96803152946f3349017d","observation_id":"c7788795-ae57-4fb6-aad1-c43ba0ca2b9a","resolution":{"observed_at":"2026-07-14T09:13:07.507164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-01T08:35:42.464663Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21672","last_updated":"2026-07-23T09:19:16Z","snapshot_observed_at":"2026-08-06T13:29:41.710952Z","submitted_at":"2026-07-23T09:19:16Z","title":"Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:42.464663Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2607.21672"},"observation_digest":"sha256:64d0ff5c4e8f7413af7aae315650751d1ea52cdd7596ad8bc390f7644793988d","observation_id":"0ab67878-b9e3-4eed-a113-05c852b32d5c","resolution":{"observed_at":"2026-08-01T08:35:42.464663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-02T11:31:21.464350Z","title":"Pix2struct: Screenshot parsing as pretraining for visual language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22600","last_updated":"2026-06-12T13:58:04Z","snapshot_observed_at":"2026-08-13T14:26:28.524859Z","submitted_at":"2026-06-12T13:58:04Z","title":"Chart Deception in Vision-Language Models: From Vulnerability to Mitigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:21.464350Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2607.22600"},"observation_digest":"sha256:11107349bfb579bdb1e2a30eb0456c41be8bcb73d84976921ad04b31931e9356","observation_id":"18b0d5b4-db97-414a-b5f6-b98474a7c1c2","resolution":{"observed_at":"2026-08-02T11:31:21.464350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2210.03347/citation-record","integrity":"/paper/2210.03347/integrity","json":"/paper/2210.03347/citation-record.json","paper":"/paper/2210.03347"},"outbound":[],"paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T14:10:47.114745Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2210.03347."}