{"as_of":"2026-08-08T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cbf730c013e3136a389d23316fb550bef4a48139142aafd8fdcc10a286f213e8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:10:38.299321Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":59,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T09:42:12.463309Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2308.13418"},"observation_digest":"sha256:73700b014406c6c4f9d07111e797c6bb22013c275808a9f946a20cb928f79983","observation_id":"4e26d4db-73a1-449a-acec-44ccab6b8d48","resolution":{"observed_at":"2026-05-16T09:42:12.587348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"reference_index":271,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:21.695801Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2410.21169"},"observation_digest":"sha256:edd0a1f1fef2698f80e0753e37ebf492448fb0a50beaf99bd51e8074f3e50f23","observation_id":"85e4b954-d1b0-45fe-9935-4a5700f88a46","resolution":{"observed_at":"2026-05-23T19:15:47.321681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-08T18:10:38.299321Z","title":"Layoutlmv2: Multi-modal pre-training for visually-rich document understanding,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.05738","last_updated":"2025-02-09T01:47:59Z","snapshot_observed_at":"2026-08-08T18:05:39.300461Z","submitted_at":"2025-02-09T01:47:59Z","title":"Performance Analysis of Traditional VQA Models Under Limited Computational Resources","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:38.299321Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2502.05738"},"observation_digest":"sha256:29c843408ffec8691349c38c68b4816f743205e31afcd97405d44d07f4165ef0","observation_id":"dee30146-85d3-47fd-849a-dbc2a2bdfa95","resolution":{"observed_at":"2026-08-08T18:10:38.299321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-07T15:42:29.988182Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-08T07:54:09.757528Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:29.988182Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:83445ed395a8953471bd19e1ba9cc5ce4990fbb1f8f6a53777aeb2984ee81086","observation_id":"ccdb6357-b1f2-4e13-87ac-e85f2b070bae","resolution":{"observed_at":"2026-08-07T15:42:29.988182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-06T20:04:12.315928Z","title":"Layoutlmv2: Multi-modal pre-training for visually-rich document understanding,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.315928Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:b7a5494c5d2bbdf3cf1535842a6d0d1bff779349650910689e0c551f90be1138","observation_id":"3ceb7149-7d64-49fe-b295-13df1a98afe5","resolution":{"observed_at":"2026-08-06T20:04:12.315928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-06T18:55:49.169064Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.08865","last_updated":"2025-07-09T14:40:40Z","snapshot_observed_at":"2026-08-07T13:51:35.119715Z","submitted_at":"2025-07-09T14:40:40Z","title":"Spatial ModernBERT: Spatial-Aware Transformer for Table and Key-Value Extraction in Financial Documents at Scale","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:49.169064Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2507.08865"},"observation_digest":"sha256:81013436408e0ced84aa309dd39ac6319f453ae9bb94cdcfccb89eae147c48bc","observation_id":"227c7055-8240-487f-ac35-2601503778e1","resolution":{"observed_at":"2026-08-06T18:55:49.169064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T23:35:24.345477Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.345477Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0e4d3191e37648ce20de3f700ba3b1576a2ee232077eb797ee4bc378dfd81384","observation_id":"67f6bfd6-7632-4801-9fc8-fadf8f7056cd","resolution":{"observed_at":"2026-08-05T23:35:24.345477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-04T07:21:32.896872Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.26615","last_updated":"2026-06-05T02:31:19Z","snapshot_observed_at":"2026-08-06T23:51:43.012890Z","submitted_at":"2025-10-30T15:41:15Z","title":"SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:32.896872Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2510.26615"},"observation_digest":"sha256:de7991b2bd1be2260d29a41e3abe1687a1989b1f1f2838e9f5947123b415b622","observation_id":"ee736245-3fe3-4144-9d31-5926535a4c6d","resolution":{"observed_at":"2026-08-04T07:21:32.896872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-08-06T15:36:32.422302Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:8514a2e5179fd823e1c04250235d5e473980c0f6a471a8b66b0353564ff239c0","observation_id":"6fc15024-0c61-4aa2-9ddf-8c353335db91","resolution":{"observed_at":"2026-05-17T22:30:23.197949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2511.22521","last_updated":"2026-04-16T14:40:49Z","snapshot_observed_at":"2026-07-06T22:37:08.086095Z","submitted_at":"2025-11-27T15:00:58Z","title":"DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T04:41:55.030673Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2511.22521"},"observation_digest":"sha256:6dc72d87b48041a4a9fb57a0a9d62eccee0cb251e1fe7273d77093b9faa35625","observation_id":"2fb0dedb-0a0e-4692-aab6-9d0c9d3a9044","resolution":{"observed_at":"2026-05-17T04:44:02.473348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2605.12623","last_updated":"2026-05-21T05:33:02Z","snapshot_observed_at":"2026-08-06T19:38:37.895679Z","submitted_at":"2026-05-12T18:09:38Z","title":"DocAtlas: Multilingual Document Understanding Across 80+ Languages","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-14T21:02:45.148167Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2605.12623"},"observation_digest":"sha256:b425a63c49dad27a66e157b38232c153a65aac54d6462fd1391ff9b260de686b","observation_id":"e2005fad-4789-424e-bc48-735e46b0e8f0","resolution":{"observed_at":"2026-05-14T21:02:58.730142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2605.12623","last_updated":"2026-05-21T05:33:02Z","snapshot_observed_at":"2026-08-06T19:38:37.895679Z","submitted_at":"2026-05-12T18:09:38Z","title":"DocAtlas: Multilingual Document Understanding Across 80+ Languages","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-22T09:51:40.160096Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2605.12623"},"observation_digest":"sha256:713976e12dede063b7a15f0756d3fad5764243ba308c0768d07e8c1b2d8cad7c","observation_id":"3b42e5ef-c7b2-405a-af00-c73d368aa3f0","resolution":{"observed_at":"2026-05-22T09:54:47.176376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2605.19866","last_updated":"2026-05-19T13:58:24Z","snapshot_observed_at":"2026-08-03T21:16:40.817874Z","submitted_at":"2026-05-19T13:58:24Z","title":"Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:48:34.771799Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2605.19866"},"observation_digest":"sha256:e494e0c47116f77eea18a36d51ee80155cec158c47b1dd1749726eeffa2ccb34","observation_id":"0d640502-46be-4f8b-9cc4-48bfaeed2348","resolution":{"observed_at":"2026-05-20T05:53:05.090079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2606.23344","last_updated":"2026-06-22T13:48:39Z","snapshot_observed_at":"2026-08-07T02:16:42.075751Z","submitted_at":"2026-06-22T13:48:39Z","title":"RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T09:19:38.285839Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2606.23344"},"observation_digest":"sha256:8a22ed0b7c51e6156b8be1984943ba2b428cc46fb484c6641a123a1386e831c7","observation_id":"8a584c8d-0fbe-4019-964a-b06601adb99b","resolution":{"observed_at":"2026-07-04T09:59:45.176564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":"2012.14740","doi":"10.48550/arxiv.2012.14740","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2012.14740 , year=","venue":"arXiv (Cornell University)","work_id":"8c444ce1-9c14-4e58-bbd2-5d1d1c3c99bb","year":2022},"citing_paper":{"arxiv_id":"2606.28796","last_updated":"2026-06-27T08:07:44Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T08:07:44Z","title":"Structure-Preserving Document Translation via Multi-Stage LLM Pipeline: A Case Study in Marathi","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-30T09:59:20.602618Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2606.28796"},"observation_digest":"sha256:bd955850f0c73689a5f940b93146937f68357dea9924e0a6b511ecf5b838511b","observation_id":"9c50434a-5b04-44d3-bcf2-5f879b329869","resolution":{"observed_at":"2026-06-30T10:04:35.270473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-02T14:38:36.756737Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24745","last_updated":"2026-05-08T07:43:02Z","snapshot_observed_at":"2026-08-05T15:50:53.366518Z","submitted_at":"2026-05-08T07:43:02Z","title":"DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:38:36.756737Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2607.24745"},"observation_digest":"sha256:a7f1763b551fe63a94548467b8a96ee4faa3c76b95c83f3392aab1e451985d20","observation_id":"2e3eaee2-2b43-4485-8c4c-cf62fbf23850","resolution":{"observed_at":"2026-08-02T14:38:36.756737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2012.14740/citation-record","integrity":"/paper/2012.14740/integrity","json":"/paper/2012.14740/citation-record.json","paper":"/paper/2012.14740"},"outbound":[],"paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2012.14740."}