{"as_of":"2026-08-10T10:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3262a1eb9795890a0ef5f627d46e8d9ba0eec1db42d4ad917ad13c0ee99564c","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:10.777750Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T04:38:49.512293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:42:04.436599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01388","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"272468d1-e25f-4763-beb4-e1a0256228ef","year":2025},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2506.01388","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:4205b6361a28f3cb8aefff7a43ce291ffe60c16c7c9ab009bd6774319071b947","observation_id":"6e2022bd-1519-4e72-9d7a-8af56266ec37","resolution":{"observed_at":"2026-05-19T04:42:04.439042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01388/citation-record","integrity":"/paper/2506.01388/integrity","json":"/paper/2506.01388/citation-record.json","paper":"/paper/2506.01388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.782050Z","title":"Form-nlu: Dataset for the form natural language understanding","venue":null,"work_id":"5c0ae19d-355e-402b-a869-b01a63839c22","year":2023},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.059090Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:39c480a314181c3f5ac6aedde36a04db3fe1fc8704e7ecccdd7d5bf3a12070bc","observation_id":"66858e4b-f5bc-4c16-86b1-5e9300c60366","resolution":{"observed_at":"2026-08-07T11:49:13.861693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17983","last_updated":"2024-07-26T06:46:19Z","snapshot_observed_at":"2026-07-06T17:36:32.068270Z","submitted_at":"2024-02-28T01:56:00Z","title":"3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding","version":3},"cited_work":{"arxiv_id":"2402.17983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17983","snapshot_observed_at":"2026-08-07T11:49:11.071419Z","title":"3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding","venue":"cs.CL","work_id":"64ea7614-6887-41fa-bc77-949bd173d5cd","year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.445020Z"},"links":{"cited_paper":"/paper/2402.17983","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:182a8905ed90a3fe674e6a055f2febe3f667b3ace10cf97776906ff1c10e7e8a","observation_id":"ea21328d-8faa-4527-b7cd-6c93d3d69b14","resolution":{"observed_at":"2026-08-07T11:49:11.108695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.618867Z","title":"Mask r-cnn","venue":null,"work_id":"1be63f68-0bb1-4c15-884d-bff8441311c5","year":2017},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.645933Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:22126c191347ed64a0fa8ed7e4764412bc23cef7b23f98fbe8d79ada34d057c0","observation_id":"4ddf283f-3cd7-4135-9c16-1951ac6b46f3","resolution":{"observed_at":"2026-08-07T11:49:13.694463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.776081Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36,","venue":null,"work_id":"befe308e-5ae2-4f2f-a456-1f400862b39e","year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.475403Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:aa47dc60867522b124d4aefba080c9745d502d8e52c8c6f0ed244ca7fbfbda9d","observation_id":"d4a62393-152b-4421-88f4-980b42b1b12c","resolution":{"observed_at":"2026-08-07T11:49:12.886130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:09.628609Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.628609Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:19ea7deb8c8b795118d383a324785af2ce9df22daf80aa53ad8eb6653c812519","observation_id":"dea4200a-6c0e-4ec7-b2fd-21b27c72125a","resolution":{"observed_at":"2026-08-07T11:49:09.628609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.535970Z","title":"Cord: a consolidated receipt dataset for post-ocr pars- ing","venue":null,"work_id":"e2cca682-1086-4788-94b1-f5d70023c21f","year":2019},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.707416Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:05227340e00981663cf3579312d2a8a4073e1b454c7d9e719c1e7fac91ee4c1e","observation_id":"cc5cc385-1a0a-4151-a9f2-c55e03706a25","resolution":{"observed_at":"2026-08-07T11:49:12.630089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.299243Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":"e0d24ded-013a-4ecc-b7f8-4d917e9efa60","year":2016},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.842186Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:42a71a050ff6ff342b502a7dc12425767ffe6215048c88ba8d53889790c9f8c1","observation_id":"53d1255f-7b73-44f8-a7b1-695661a9ab82","resolution":{"observed_at":"2026-08-07T11:49:12.402963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:11.594272Z","title":"Towards robust visual information extraction in real world: New dataset and novel solution","venue":null,"work_id":"d5755216-b30a-46fc-9bd9-1186a15f8365","year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.340936Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:3b4c87ab2049cd709f038f35395c585e19e0f198c6457496e18f78244fa41a74","observation_id":"543dd6a1-9e1e-436f-ab5a-916c46b4e8d3","resolution":{"observed_at":"2026-08-07T11:49:11.711186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-07T11:49:10.488825Z","title":"Layoutxlm: Multimodal pre-training for multilin- gual visually-rich document understanding.arXiv preprint arXiv:2104.08836,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.488825Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:84220213602e1df6e51a96ec81e78fdc76b75897d2c6625636b076058d72ad24","observation_id":"8337f539-ca88-4a94-ac26-752cbbdbf8a1","resolution":{"observed_at":"2026-08-07T11:49:10.488825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:10.632836Z","title":"xgen-mm (blip-3): A family of open large multimodal models.arXiv preprint arXiv:2408.08872,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.632836Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:70b6944c108dd768259f2a06a7bd61d3e0b3c1ebfaa454b346340b30e2297f51","observation_id":"ed0ceba4-9e7c-4f19-95d3-5f1362107066","resolution":{"observed_at":"2026-08-07T11:49:10.632836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:11.324716Z","title":"Detrs beat yolos on real-time object de- tection","venue":null,"work_id":"0ddefd73-5bd0-4f31-b2d6-26c6d8dc1a7e","year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.777750Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:d8fed165a3f845d8e7fc4be5279b232212007184e77c81cc549d4431af69d613","observation_id":"66ac4e59-5f8b-464d-ad6b-1c3e5a998a2b","resolution":{"observed_at":"2026-08-07T11:49:11.441845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.025010Z","title":"Kleister: key information extraction datasets involving long documents with complex layouts","venue":null,"work_id":"50457d40-8126-4566-b47e-2d663881fedb","year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.104836Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:69c1be3a2bb8062bd7877116469a15b0788e7d7783d5258eb09dadcbe8bcb4bc","observation_id":"b44f0f5e-c3a8-4266-a7e9-e3cddaa59010","resolution":{"observed_at":"2026-08-07T11:49:12.141867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:09.961206Z","title":"Faster r-cnn: Towards real-time ob- ject detection with region proposal networks.Advances in neural information processing systems, 28,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.961206Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:2144b19a5b0981db8206b41ff7b0c6794f21ca8c4907465ea61881ee3b851b9c","observation_id":"57ef1854-b6c7-403c-a274-757055004725","resolution":{"observed_at":"2026-08-07T11:49:09.961206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.484467Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"cc1c17fa-fdd0-4b57-899d-cd7e9208bcbf","year":2019},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.842306Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:398cba6a116a83b2afbc1a16669f69515f14a0ad4bd9a0b28824ca10afe3a4ab","observation_id":"a6a21c81-ceae-488b-adf1-bccb94a64354","resolution":{"observed_at":"2026-08-07T11:49:13.536986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.245345Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"bf34d481-c959-4688-b203-1262cee1e8f6","year":2022},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.987749Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:678263e6b2e5d265aa487ec1c562702c6cafff3625a8338949b5cf5d80a70369","observation_id":"27088a13-a74f-44e8-89d0-052d6c690446","resolution":{"observed_at":"2026-08-07T11:49:13.374992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:11.821717Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"8247b1b6-5de8-4654-a1da-9c0544e58bd2","year":2023},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.233981Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:efa0c610a331b37c996000b58335977cf3a28a41c91920d43962a6fd0d3a944f","observation_id":"f1697ce6-a1d4-4c7d-abb0-a4bcab3d657b","resolution":{"observed_at":"2026-08-07T11:49:11.928334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.034542Z","title":"Dit: Self-supervised pre- training for document image transformer","venue":null,"work_id":"9b624424-9b47-4f74-abaf-9785c6efc290","year":2022},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.141603Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:69583591cf75640cc68b3f49e13a16dac5c4aa86618d2399ba6f50626bbbfa50","observation_id":"d13bf1e7-d242-4def-87fb-9122e04bcc48","resolution":{"observed_at":"2026-08-07T11:49:13.125103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:08.221446Z","title":"David: Domain adap- tive visually-rich document understanding with synthetic insights.arXiv preprint arXiv:2410.01609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.221446Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:3f989bbe1290d22779ddc28d59a32f22fc81e9afc82c0312ffc01ca8e329ef20","observation_id":"29675e18-bc61-4d54-a1b8-bd3c025bcad1","resolution":{"observed_at":"2026-08-07T11:49:08.221446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12720","last_updated":"2024-04-19T09:00:05Z","snapshot_observed_at":"2026-07-06T18:02:36.759308Z","submitted_at":"2024-04-19T09:00:05Z","title":"PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12720","snapshot_observed_at":"2026-08-07T11:49:08.346682Z","title":"Mvqa: A dataset for multimodal information retrieval in pdf- based visual question answering.arXiv preprint arXiv:2404.12720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.346682Z"},"links":{"cited_paper":"/paper/2404.12720","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:0f7e35afdbc874cd90696876185df2249682671de96f4925599baa1fef487cd6","observation_id":"11227b6e-6f49-4fa6-9d1c-ed6ce3a5b060","resolution":{"observed_at":"2026-08-07T11:49:08.346682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T05:59:00.365430Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2506.01388."}