{"as_of":"2026-08-10T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27ae196d8631ee87adc797d79a660138bfd56f3ad54e3a5b0b41cba3157c6485","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:17:27.907885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:09.476068Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:aa0975ec9cbb0e7e088eded5e13bf00d35ec85c33dc765770720a9284dc54368","observation_id":"9fc75294-2741-4978-a25d-8c0ab778eea9","resolution":{"observed_at":"2026-05-12T07:08:36.126572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:672d8481bef54f2a5c8a4f090411887561f91c58ee03b57302e03c55d4230f88","observation_id":"50d9352d-b38e-467e-b124-af0163694f8b","resolution":{"observed_at":"2026-05-11T13:10:20.770367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:07.523565Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2412.03555"},"observation_digest":"sha256:f62a343c4bf3dcc67634befd9897a7232ddb848b972c6553a5818948c541c4cb","observation_id":"db46a353-cc1a-4cdc-8314-d9c82893565f","resolution":{"observed_at":"2026-05-15T09:15:07.712195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-10T22:17:27.907885Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-10T23:31:57.361254Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.907885Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:bd4cabd153d0471d4172feca9426e33cbcf921e1c5bddf5543d5a4b2d8e57709","observation_id":"40a4441b-ee2c-4614-a220-41721203a39b","resolution":{"observed_at":"2026-08-10T22:17:27.907885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:739ccbfc83cd88de64eeb6f674d7cf1006e3ae41d6d4106fa38b6907d1016b12","observation_id":"369fbbf5-48c1-4fab-94fc-9a7d3f52ddf4","resolution":{"observed_at":"2026-05-22T19:52:01.796335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T13:53:24.790502Z","title":"Docvqa: a dataset for vqa on document images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.790502Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:37a2edb0451ff40d20369a9924b50573b1436d7645268d12f79d006f0799d06b","observation_id":"99fdb9fa-25a6-4dd7-960c-7f37b6558ffc","resolution":{"observed_at":"2026-08-07T13:53:24.790502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T12:52:39.942212Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-07T21:49:28.223898Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.942212Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:4bac1316ef89ea04c9f9ee46028104949f894022257889d72d61437bda3a5aeb","observation_id":"eab244cd-062d-451b-91ab-aaaca92a01da","resolution":{"observed_at":"2026-08-07T12:52:39.942212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T12:09:06.849342Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:06.849342Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:a7db3dc7dac3601368ad4b541a48215235dfda2d61f5556c69e338f8be866f39","observation_id":"7e1f81cd-a1b2-4d68-b093-2d83107fdba0","resolution":{"observed_at":"2026-08-07T12:09:06.849342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T10:27:36.789692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05182","last_updated":"2025-08-20T20:52:35Z","snapshot_observed_at":"2026-08-08T14:59:33.448999Z","submitted_at":"2025-06-05T15:52:44Z","title":"On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:27:36.789692Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2506.05182"},"observation_digest":"sha256:f4c7fe43c1482a4d565032c8e3ae279b667eb644e93d0eecfe7b929e1fd4b95e","observation_id":"202d097c-9a67-4c76-85eb-19e2422e6c74","resolution":{"observed_at":"2026-08-07T10:27:36.789692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-06T17:59:05.622333Z","title":"Docvqa: a dataset for vqa on docu- ment images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.622333Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:ad0d3c5a431412e2a8343c6ac9db6f4ba1365035bbb59428c68b7b4333dfdc56","observation_id":"40e38e9f-cae0-47d4-9c06-2aae302fb3f7","resolution":{"observed_at":"2026-08-06T17:59:05.622333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-06T16:39:20.935176Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15875","last_updated":"2025-07-17T09:05:34Z","snapshot_observed_at":"2026-08-07T23:04:29.954585Z","submitted_at":"2025-07-17T09:05:34Z","title":"Differential Multimodal Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:20.935176Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2507.15875"},"observation_digest":"sha256:de7fe0eb3b56dd75654be7ae5b0e4280dc2acd77efeb358a9f10910c6ebf8677","observation_id":"d6733d6f-d499-4144-9636-5486db821583","resolution":{"observed_at":"2026-08-06T16:39:20.935176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-06T10:14:26.472521Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00356","last_updated":"2025-08-01T06:39:15Z","snapshot_observed_at":"2026-08-06T13:48:27.648409Z","submitted_at":"2025-08-01T06:39:15Z","title":"Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:14:26.472521Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2508.00356"},"observation_digest":"sha256:28ff6ffd8c1a3da094af15408c3c8b8f189bbe373aa83d83adc068844072157e","observation_id":"b8386a33-20c2-4723-803b-f2ef52d0b13a","resolution":{"observed_at":"2026-08-06T10:14:26.472521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-05T11:11:20.832097Z","title":"Mathew, D","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.832097Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:2549f475cc72556509554504b22cc0130cc07a0eea8c620b87ef17aab7d4e132","observation_id":"2b5709b0-a04a-4bd6-87d9-71b46c381cc6","resolution":{"observed_at":"2026-08-05T11:11:20.832097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2509.07966","last_updated":"2026-04-21T15:48:38Z","snapshot_observed_at":"2026-07-06T22:27:15.482704Z","submitted_at":"2025-09-09T17:52:26Z","title":"Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T17:37:31.837022Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2509.07966"},"observation_digest":"sha256:fe5bd06daea3ff77a7ecbf5f0a372e616f72a6601377f0dd4dc72d3be4126732","observation_id":"054fa4f0-9302-40b0-aa7c-d26a758aa5bf","resolution":{"observed_at":"2026-05-18T17:42:47.586020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2511.01831","last_updated":"2026-04-06T20:32:02Z","snapshot_observed_at":"2026-08-02T08:19:53.364576Z","submitted_at":"2025-11-03T18:39:32Z","title":"Routing-Based Continual Learning for Multimodal Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T00:52:36.700027Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2511.01831"},"observation_digest":"sha256:dcec008802f66f2c7320e6e2305029e4bc5d02cad9e9042299af4258fbff59dd","observation_id":"ab61b841-c5db-45f1-afeb-b8d1dd3d97dd","resolution":{"observed_at":"2026-05-18T00:55:35.336139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2511.14998","last_updated":"2026-04-07T03:13:19Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-19T00:41:14Z","title":"FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:52.701262Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2511.14998"},"observation_digest":"sha256:9c93af3075e18fa419d68b3cc99bf91b845757ec8d7d23b116fe36c0fb910ef9","observation_id":"2fdfb66c-d33a-4093-b387-627443e15855","resolution":{"observed_at":"2026-05-17T20:20:11.510920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-02T19:41:33.738459Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:33.738459Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:01c11df0f4a173b2f8674e78481f408950050772ec61f0a149da7ef7b6ea43b8","observation_id":"2d897ada-8f28-4f91-9800-5f8d6012ed55","resolution":{"observed_at":"2026-08-02T19:41:33.738459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.04901","last_updated":"2026-04-06T17:49:31Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:49:31Z","title":"FileGram: Grounding Agent Personalization in File-System Behavioral Traces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:33:57.643549Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.04901"},"observation_digest":"sha256:34130c51e9e24b93a7dbc202e85114fe2b1e60120cd5757daa437737f34051f0","observation_id":"e8010136-aa82-4ae3-8ded-81593f01f200","resolution":{"observed_at":"2026-05-10T22:45:51.276505Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-04T18:58:19.981225Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:79619c8e83f0a15dc9b9173b2fa8c15e5895bcfea56be1aaf53ab3aeca6deea1","observation_id":"756994a1-db77-498a-90b5-6873aee623f7","resolution":{"observed_at":"2026-05-10T23:55:52.856348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.08212","last_updated":"2026-04-09T13:11:30Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:11:30Z","title":"Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:39.410040Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.08212"},"observation_digest":"sha256:cef136b5c79b985aaafd88db5cf92595083502129f7d0bc41ee5cbd4f904f553","observation_id":"99a7eafb-0ef2-47b6-bbc3-23c10c5fed5c","resolution":{"observed_at":"2026-05-11T06:41:22.377691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-07-06T22:57:31.046146Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:6e074e385e3042ef0dc18534b6ee53b02b23007f07fa23b2dc66cf33e8597445","observation_id":"f54d59ad-4dd6-4343-9bec-42260ac96d19","resolution":{"observed_at":"2026-05-11T07:16:11.146347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.14799","last_updated":"2026-04-16T09:23:22Z","snapshot_observed_at":"2026-08-02T12:46:46.976919Z","submitted_at":"2026-04-16T09:23:22Z","title":"Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:13.100463Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.14799"},"observation_digest":"sha256:25b36dc4d563aa0797f15966c5b41848a8db681e3107a3a2110f2921e829032e","observation_id":"ed301277-68ed-493f-b006-79df3acf6942","resolution":{"observed_at":"2026-05-10T11:50:20.766938Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.19503","last_updated":"2026-05-09T05:54:49Z","snapshot_observed_at":"2026-08-06T04:17:17.024078Z","submitted_at":"2026-04-21T14:22:04Z","title":"ReaLB: Real-Time Load Balancing for Multimodal MoE Inference","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T01:18:27.597377Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.19503"},"observation_digest":"sha256:37b55b5b022dae21a1d09309b4d9e5c3d19f21423e4aa482f0ef172bcd99c956","observation_id":"1bb123da-ab2f-465d-98e3-8289bbacef79","resolution":{"observed_at":"2026-05-11T13:36:10.208047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.19945","last_updated":"2026-04-21T19:48:19Z","snapshot_observed_at":"2026-08-02T17:45:19.558396Z","submitted_at":"2026-04-21T19:48:19Z","title":"Visual Reasoning through Tool-supervised Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T03:05:21.688216Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.19945"},"observation_digest":"sha256:e0e4564782169b1e62e8dd5465a060d51684c064f04d8230b5fe6818164980a8","observation_id":"fd9d38bd-1825-406a-be64-8868f184dab1","resolution":{"observed_at":"2026-05-11T12:46:03.231775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.25185","last_updated":"2026-06-18T03:00:25Z","snapshot_observed_at":"2026-08-05T20:03:52.003085Z","submitted_at":"2026-04-28T03:43:53Z","title":"The category of Whittaker modules over the Cartan Type Lie algebra $\\bar{S}_2$","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T09:08:06.592577Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.25185"},"observation_digest":"sha256:d3e67549c6efa062bab1d6a49fd0c2ec543b5ccde6d4d85b3b15c3d3dc901069","observation_id":"38b54dfb-70d2-4d82-9413-4a23a8d5eea4","resolution":{"observed_at":"2026-07-01T09:25:40.475504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2604.25186","last_updated":"2026-04-30T03:30:43Z","snapshot_observed_at":"2026-08-10T21:39:03.625679Z","submitted_at":"2026-04-28T03:45:09Z","title":"FCMBench-Video: Benchmarking Document Video Intelligence","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T17:14:19.186123Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2604.25186"},"observation_digest":"sha256:52dcaee6475afcc3fef62231a3985227454add93262dcfca52c0d0554a3a1d87","observation_id":"3b1e86e4-3282-4455-a195-5d9290b8e94a","resolution":{"observed_at":"2026-05-11T23:21:41.346550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2605.04075","last_updated":"2026-04-14T08:17:53Z","snapshot_observed_at":"2026-08-03T03:08:39.084770Z","submitted_at":"2026-04-14T08:17:53Z","title":"RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T15:29:17.567557Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2605.04075"},"observation_digest":"sha256:a51f2c786a855d36eb0d060c70cb499efdca13e72204a2bac4ce43d50fcda83c","observation_id":"fec6371b-9edf-4e6c-b000-4668c7c106e8","resolution":{"observed_at":"2026-05-11T10:26:02.150150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2605.20950","last_updated":"2026-05-20T09:37:53Z","snapshot_observed_at":"2026-07-06T23:31:27.989406Z","submitted_at":"2026-05-20T09:37:53Z","title":"Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-21T05:20:55.448430Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2605.20950"},"observation_digest":"sha256:937660fcdc4623b07c3af01d6dbf48a45464028c1b8485a1635c06e1238b23ba","observation_id":"430876f6-6afd-4c69-92ed-2e3c253887b0","resolution":{"observed_at":"2026-05-21T05:23:58.581700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2605.30244","last_updated":"2026-05-28T17:11:03Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:11:03Z","title":"Reinforcement Learning with Robust Rubric Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T07:39:21.677389Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2605.30244"},"observation_digest":"sha256:8b32d166ef2a865c99331f94ff89d6af73a98a9373af9ed239864684a5d2e041","observation_id":"fdc13621-692c-4c1a-9d69-acb3c29209ca","resolution":{"observed_at":"2026-06-29T07:43:13.742120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:54:10.460872Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:da79aa77198f4c1f045e3431d8ca7cef87eae1a6548d1c8a209b2b8c72d4adb1","observation_id":"cbe0c011-0592-4df5-9f91-8eeaf596ab3f","resolution":{"observed_at":"2026-07-01T19:16:00.977140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:d9c648f0b698f45e0a1cb14736a23ec0714d3cc128ab0b954496d0feb741b4df","observation_id":"4c9a5c00-a365-4c3e-89fc-85f4d9e504a0","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2606.17110","last_updated":"2026-06-15T07:04:01Z","snapshot_observed_at":"2026-08-05T23:11:05.452983Z","submitted_at":"2026-06-15T07:04:01Z","title":"Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T03:59:30.468854Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2606.17110"},"observation_digest":"sha256:65407cb087de566a2e02733ac8cb90f8a551c09279d1b7ad00221009113f124d","observation_id":"010cabf7-d743-4021-b8fc-fcd648a84a74","resolution":{"observed_at":"2026-07-03T17:38:43.814213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2606.26041","last_updated":"2026-06-24T17:15:42Z","snapshot_observed_at":"2026-08-02T15:35:24.404490Z","submitted_at":"2026-06-24T17:15:42Z","title":"How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-25T19:13:27.527971Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2606.26041"},"observation_digest":"sha256:cec4a2d39d1b2440d0eb31a1b78b2abfd8e94cf9b054bd6519422a46e8f5be3c","observation_id":"1bf935f7-a473-45a5-873b-0012da53ba03","resolution":{"observed_at":"2026-07-04T21:00:09.477417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:dc3fdacd69ef68b9bb26ec8a86ab5890468b10cacd9cf70e07791d933aa96c13","observation_id":"d3a070c7-8575-4c1c-96f1-715e82e35265","resolution":{"observed_at":"2026-07-03T14:48:32.412815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:3a106badbd490609ef891faf22af91562cedf3be5db59f4870287287e020c98a","observation_id":"d0a1ea24-90f5-47ea-a7ef-7e51dccc1a17","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-31T06:18:55.901623Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.901623Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:088e42c59fe24a7c507b44a63265ddee7cefd4907f67066d9f12124d7f1fe373","observation_id":"7e001a6e-0255-4ee9-93d8-2d2459c10395","resolution":{"observed_at":"2026-07-31T06:18:55.901623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-02T14:38:35.492534Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24745","last_updated":"2026-05-08T07:43:02Z","snapshot_observed_at":"2026-08-09T21:17:47.173505Z","submitted_at":"2026-05-08T07:43:02Z","title":"DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:38:35.492534Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2607.24745"},"observation_digest":"sha256:c230c82694d61cc6cf6c6498a7190b4a7b4a4cb6841456c7fdbc61e15825c5fa","observation_id":"2774c8d8-9c4f-4ac0-b7c5-6e6d4d973c7e","resolution":{"observed_at":"2026-08-02T14:38:35.492534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-01T02:55:23.403485Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25294","last_updated":"2026-07-28T05:06:43Z","snapshot_observed_at":"2026-08-06T17:57:12.013512Z","submitted_at":"2026-07-28T05:06:43Z","title":"CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:23.403485Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2607.25294"},"observation_digest":"sha256:48c3415413b2a9c8977c6775e40458999be473d451cd0a9726ff3208897aea84","observation_id":"86b507e3-44ac-49ba-a61e-a3f591c852f8","resolution":{"observed_at":"2026-08-01T02:55:23.403485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-05T04:26:29.325114Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02636","last_updated":"2026-07-31T04:02:51Z","snapshot_observed_at":"2026-08-09T14:34:24.393371Z","submitted_at":"2026-07-31T04:02:51Z","title":"Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:26:29.325114Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2608.02636"},"observation_digest":"sha256:d9388947245f4e17f0a59a077f725c4e58e6fafd70814ef74bbcc82f733895ea","observation_id":"d129ac94-b538-4ea4-b655-27c8cecd55c1","resolution":{"observed_at":"2026-08-05T04:26:29.325114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2007.00398/citation-record","integrity":"/paper/2007.00398/integrity","json":"/paper/2007.00398/citation-record.json","paper":"/paper/2007.00398"},"outbound":[],"paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2007.00398."}