{"as_of":"2026-08-11T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26dcf0fb7c1a7ab69c2edee57846c4cb32fee0c6289129f15834b3887e25f368","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:59:07.601054Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09531/citation-record","integrity":"/paper/2507.09531/integrity","json":"/paper/2507.09531/citation-record.json","paper":"/paper/2507.09531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.818505Z","title":"Docformer: End-to-end transformer for document understanding","venue":null,"work_id":"2385216b-ebbc-4709-8cd0-4ba7f0d49aee","year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:02.282868Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:f599adfe253454e662d31e13a3397a3141b2b8588dbe388c630133950b2fb6da","observation_id":"29dfd4c0-64c6-4a2c-acdd-19fef097dacb","resolution":{"observed_at":"2026-08-06T17:59:15.872435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.669583Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization","venue":null,"work_id":"4a63f169-7d25-4ba5-ad17-3f679322abc6","year":null},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:02.385870Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:0588ef0e1c2393cd65a5e29c3e379db19913c5a63abd7262c6a474ea737b688a","observation_id":"5508c845-f007-4386-b509-bdb252ee4268","resolution":{"observed_at":"2026-08-06T17:59:15.717043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.573143Z","title":"Due: End-to-end document understand- ing benchmark","venue":null,"work_id":"45f5feb1-24ce-4657-a5a5-cd00ab37f932","year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:02.495887Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:6972691e6b58af47e4e0e84a4383257fb563310b728978b3366e86094a625ccc","observation_id":"39ece4dc-3400-49d9-a18a-1fba010b1dc6","resolution":{"observed_at":"2026-08-06T17:59:15.610275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T17:59:02.588039Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:02.588039Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:2a67df9b619a6ea629b0746d69542eabd3b09bf48503068902ffc52acdbc400e","observation_id":"e0ffee70-b30d-4c9a-a799-f5fae76f8f5d","resolution":{"observed_at":"2026-08-06T17:59:02.588039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.454961Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"f7794cc8-5f71-49f3-94c5-0b216238d07e","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:02.710552Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:e681931b6d33e5adf6ebbcbe9ccc53dbab63bf75672d16857d1225acf843904c","observation_id":"be0e5316-1b31-4aa0-94eb-a6704667ce56","resolution":{"observed_at":"2026-08-06T17:59:15.523868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.300852Z","title":"Instructblip: towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"8dd4a117-7701-4fd9-8ee6-8833ffac091e","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:02.852460Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:b78d37b70ce0bf675ce2d6f8e783ad63c30d5e2d05fd45fbf768bd0bf44b4142","observation_id":"ad2367e2-b82d-45f9-8574-151d13ee6d98","resolution":{"observed_at":"2026-08-06T17:59:15.377660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.156193Z","title":"Docpedia: Unleashing the power of large multimodal model in the frequency domain for versatile document understanding","venue":null,"work_id":"4e614ce0-826a-47f0-97f4-2123f5e90b14","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.002811Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:5bd48371b50705a2db69beaeaa398e8aaa5699525054aebd9d08213e518e175a","observation_id":"2562b1e0-86bb-4dd2-b276-104e062ac7ab","resolution":{"observed_at":"2026-08-06T17:59:15.224822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:15.008352Z","title":"Unidoc: Unified pretraining framework for document understanding","venue":null,"work_id":"805aaba2-ec5b-4924-a051-f34bf2fd9bdd","year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.160371Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:04d95b7f44455314fadc7b17333586075488644755f0c6551813cdd3ee748e9c","observation_id":"72ea372f-a773-49ab-b868-f35ea1b0ddd1","resolution":{"observed_at":"2026-08-06T17:59:15.072082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:14.879769Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"b3e71d98-cb42-49a7-a0eb-980a8c5c7bfb","year":2016},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.291969Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:aeebba256703047b6c0b87ea91f0d688eef67edb940ecab0e930430222a9bfe1","observation_id":"e1a838da-28c7-4965-8f29-5a4561e6547e","resolution":{"observed_at":"2026-08-06T17:59:14.952677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T17:59:03.420452Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.420452Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:4febfd9caa6a4abc282755f5dc2a39d197d130b88de93e41d95908174b9d67fc","observation_id":"b584473d-7079-4be1-ace2-70cadbd24256","resolution":{"observed_at":"2026-08-06T17:59:03.420452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:14.729820Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"34066757-e347-4af8-b992-ce7c9e8e3fa2","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.568961Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:37e9c76684a4f12ec2757340a2470f7e70c091340bc62154b480c166313f31fd","observation_id":"1fec0b0f-ce6d-4e54-ad0f-301f5e9fcad5","resolution":{"observed_at":"2026-08-06T17:59:14.780291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:14.489400Z","title":"SciCap: Generating captions for scientific figures","venue":null,"work_id":"3120c3d3-6f78-408e-ae45-2b82200d89f7","year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.706824Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:06bdb324858151a3de144da06e4efed5486ebcd1d34900c4a14b992c236d0c1e","observation_id":"33ee729d-cb83-4a84-8245-2eb18fe80198","resolution":{"observed_at":"2026-08-06T17:59:14.636710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:14.223908Z","title":"mPLUG-DocOwl 1.5: Unified structure learning for OCR- free document understanding","venue":null,"work_id":"cd93bf95-9727-44b2-95c6-8d7fac698f8f","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.804645Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:ebcef2f7249270d7d4ebac8b97166dcbd7d16e7f5f8085962cfadcdff98dbeab","observation_id":"d7737523-5de0-43c3-a758-44fe24b45c1a","resolution":{"observed_at":"2026-08-06T17:59:14.349022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:03.901686Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.901686Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:a8f77be0c22bdc1cb7e732975e69b0d63927df9a0e565da1dc52066c0375b27f","observation_id":"9bff7f50-ba8c-4efd-80dd-554c471ec62a","resolution":{"observed_at":"2026-08-06T17:59:03.901686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:14.033683Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"7b63e5cd-d1d6-406a-8d71-a3bd9c237d8f","year":null},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:03.994382Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:6d7061a294d75d2171ee6a1cd5799a1847c87e123768d61ac7516df6ec516b57","observation_id":"6606b3e1-991a-42ff-b0e2-62480fe7f54c","resolution":{"observed_at":"2026-08-06T17:59:14.125109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:13.882274Z","title":"Icdar2019 compe- tition on scanned receipt ocr and information extraction","venue":null,"work_id":"c36594db-69cb-4f3e-bb7c-b58f1eb581d8","year":2019},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.108908Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:022b2686c34a436d732927a85409e463115a289fe30dabe7a702618e8a791ef0","observation_id":"85147d98-064b-4328-8385-1b3d0f26df68","resolution":{"observed_at":"2026-08-06T17:59:13.931638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:13.641281Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"3f63db0c-c96a-47c7-b9d4-058ce5290d10","year":2019},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.178898Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:c1f362504c7e33205c8f19b6dd0d24236be0b4b9ab37a54c45829f2f020fb6b6","observation_id":"bc7d70da-177f-46f5-99f3-9c8024905df1","resolution":{"observed_at":"2026-08-06T17:59:13.748786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:04.251928Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.251928Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:01b0a90e31ae36a31111c7799580c813d3258c2cf2da9b1609d7499332d872e7","observation_id":"320e75f1-9534-4125-b13f-1c8c709c3879","resolution":{"observed_at":"2026-08-06T17:59:04.251928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-06T10:03:36.325862Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-06T17:59:04.304286Z","title":"Donut: Docu- ment understanding transformer without ocr","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.304286Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:43af32a388c145488ef4ce79f207cda7ca71a76707e8465829ee3f909af86ef7","observation_id":"dfc00b05-2fac-41d0-b892-0692a689a5ee","resolution":{"observed_at":"2026-08-06T17:59:04.304286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:13.447961Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"7fb433aa-0dbe-4335-afc8-e2a1b5216f1c","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.375812Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:0a8f5e6b8905ec9ee4444196ae30c9358b3635d976789c3b4e73f089efe73b7f","observation_id":"6689e449-4978-47f0-ae20-f53b79396df4","resolution":{"observed_at":"2026-08-06T17:59:13.530535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:13.323912Z","title":"DocBank: A bench- mark dataset for document layout analysis","venue":null,"work_id":"8521eb66-1718-44ee-9b5c-0fe984baa184","year":2020},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.408043Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:25279cc4770e8f43adfdbc8586b173785ea40957ebcdd2612a94f3c18a8210a4","observation_id":"e7f6cae0-596e-4cba-adb2-cdd848a8e768","resolution":{"observed_at":"2026-08-06T17:59:13.380065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:13.155777Z","title":"Selfdoc: Self-supervised document representation learning","venue":null,"work_id":"340c26d3-cddb-4b05-a071-8c6fa9d17f81","year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.482077Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:fd8865e26155317a30875c8028c5a367a71406feb8c7f0d4ce3c3ddee0aac94c","observation_id":"9729aeed-e6c8-4829-95ab-5a0d911f373b","resolution":{"observed_at":"2026-08-06T17:59:13.238668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:12.981000Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"eb154f92-556b-403f-8078-fee0f244244b","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.555642Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:afd72a21a49c39b54b93ec3caa19dbd8f99421dacb64fe9760bfeebf02f2c900","observation_id":"c7a26764-3cc7-479d-8571-a0fc72c79c92","resolution":{"observed_at":"2026-08-06T17:59:13.072147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15045","last_updated":"2025-03-19T10:05:04Z","snapshot_observed_at":"2026-08-06T18:59:22.667732Z","submitted_at":"2024-08-27T13:13:38Z","title":"DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15045","snapshot_observed_at":"2026-08-06T17:59:04.645195Z","title":"Doclayllm: An efficient and effective multi-modal extension of large language mod- els for text-rich document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.645195Z"},"links":{"cited_paper":"/paper/2408.15045","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:bf776fd626f04f083668f83a0fd4b1c041c0f7d3a780e7a77df882f2d37c84b5","observation_id":"e2683014-4149-4068-9dce-8ebb7e5ef479","resolution":{"observed_at":"2026-08-06T17:59:04.645195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:04.806022Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.806022Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:5ebc671451cb31cf9e036c8eae3d181e0e9a52fe90addad2d5442fb4cf382054","observation_id":"1ad7ffd0-f94a-426d-80db-5125b053fac6","resolution":{"observed_at":"2026-08-06T17:59:04.806022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:04.947845Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:04.947845Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:8c3b74c052c8514b6647d7b82a2f42558ff3a6e61b2d6048a735dd7a3b2be1c9","observation_id":"4d80c291-eed3-44fe-9945-e8fa849f5100","resolution":{"observed_at":"2026-08-06T17:59:04.947845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:05.026870Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.026870Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:91aef410463ecbd3c4b5900a32e1fcd446d52faf69ef8f47b402ce269d7a2220","observation_id":"e7fb894e-2d7d-48e7-8cc2-7cd6a526d8ac","resolution":{"observed_at":"2026-08-06T17:59:05.026870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:12.690308Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"20d68208-fa6e-40f7-ac5d-8cf5d4cc3d9b","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.121906Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:8c58723fcdd340604e365d2fcc821b52d3f8a64c09cfb31e6309691ca63cdb96","observation_id":"02842439-b046-4944-b9c5-5a46b0a4d168","resolution":{"observed_at":"2026-08-06T17:59:12.802843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T17:59:05.251861Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.251861Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:a70fe7b81412668208f1f588882335185ff4a5ab559108fa19d1634c855bd251","observation_id":"cc6f6b2f-255c-40f5-b1df-25125e92583b","resolution":{"observed_at":"2026-08-06T17:59:05.251861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:12.403583Z","title":"Swin transformer v2: Scaling up capacity and resolution","venue":null,"work_id":"ca4bee0e-bb04-4ee9-90d0-6252273cafb0","year":2022},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.329805Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:1b1975794027a1fb0dd78a2156f4d417a7119291a25e27b10a73d9ef96b621cd","observation_id":"691dc397-de21-4031-8702-cf906a213fb4","resolution":{"observed_at":"2026-08-06T17:59:12.531717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-06T17:59:05.416342Z","title":"Sgdr: Stochas- tic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.416342Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:1fad8cf18d7a298d004e4a90b87563ac47e25e84a862ae64fa4a893084f25d74","observation_id":"f052739d-9cc9-4a47-94f9-cabd4510cc10","resolution":{"observed_at":"2026-08-06T17:59:05.416342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T17:59:05.480905Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.480905Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:bc21b5f9381edaf49fcf300236a0d2aed04c14b768082d3959b4aed9718ba178","observation_id":"7544abc3-553f-4d8b-90f1-89d96377dff3","resolution":{"observed_at":"2026-08-06T17:59:05.480905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:05.531100Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.531100Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:382abe6e6b0e0c22ac019458f9c94efedc9768bbeefeab8fb48dce7029293571","observation_id":"90a8901b-f628-45d3-a1e1-3cf2a4e7b441","resolution":{"observed_at":"2026-08-06T17:59:05.531100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-06T17:59:05.622333Z","title":"Docvqa: a dataset for vqa on docu- ment images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.622333Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:ad0d3c5a431412e2a8343c6ac9db6f4ba1365035bbb59428c68b7b4333dfdc56","observation_id":"40e38e9f-cae0-47d4-9c06-2aae302fb3f7","resolution":{"observed_at":"2026-08-06T17:59:05.622333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:12.057704Z","title":"Azure Cognitive Services: Optical Char- acter Recognition (OCR)","venue":null,"work_id":"ff3861d2-7b60-42d0-80ce-2dcc0ae55cf5","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.739431Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:97ce15f050c9fc709b524b1161feed5231ceed36c9fc3aac120c9b4cedfeb098","observation_id":"33e1d906-ab40-46a0-bc34-7c2a5cd57de4","resolution":{"observed_at":"2026-08-06T17:59:12.216896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:11.774683Z","title":"Rectified linear units im- prove restricted boltzmann machines","venue":null,"work_id":"284714bb-3e30-40aa-a33c-d9f46504ef1b","year":2010},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.831731Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:d5752397f068cc0fa2a7bbe6587dbdf671f700c5bd1af83981ff1e16de915f74","observation_id":"bc0fdc9f-f52d-4fb0-a1f5-a8e1a0ee34e9","resolution":{"observed_at":"2026-08-06T17:59:11.930770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:11.550897Z","title":"Cord: a con- solidated receipt dataset for post-ocr parsing","venue":null,"work_id":"de08dcfe-ef81-471a-854a-9505a0d73595","year":2019},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:05.927075Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:396147b9557dbc3e62d105fd27630d525ab417e2ac99b9e206a0bd3a75967142","observation_id":"dc51e973-6da0-455a-a2b2-dc51d816a9c2","resolution":{"observed_at":"2026-08-06T17:59:11.644166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:11.308104Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"4fbd091e-5a1b-499d-abf3-650d81076cb6","year":2017},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.001101Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:14ea5f313dc4b33972ea6d357ab4cacb2d449f77468e61395c30ab31b4f7b0ff","observation_id":"0534d87b-bb01-452c-bb25-29b97a652f07","resolution":{"observed_at":"2026-08-06T17:59:11.417501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:11.111622Z","title":"Doclaynet: A large human- annotated dataset for document-layout segmentation","venue":null,"work_id":"4ec99f54-e25d-4a69-b44f-f0bce6a46b07","year":2022},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.059606Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:fb02ba0e2b9ef74b1c5d8ab4d49c574b5100cfec13c0008a8021c71eb16330c8","observation_id":"400d844d-0b27-4646-8b4a-c68848708a74","resolution":{"observed_at":"2026-08-06T17:59:11.171317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:06.153026Z","title":"Going full-tilt boogie on document understanding with text-image-layout transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.153026Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:4552b275d28552dc3f5b377d00c46ac4999a4c26932e02fa9cedd60d28bdbb97","observation_id":"519d9a20-7fff-4027-8483-af81641f1a3a","resolution":{"observed_at":"2026-08-06T17:59:06.153026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:09.446416Z","title":"Deepspeed: System optimizations enable train- ing deep learning models with over 100 billion parameters","venue":null,"work_id":"9b7bc43b-eca7-481b-b8b6-f4f4650c177f","year":2020},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.200056Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:6ba0d187a5ec8a4e3ef981ab0bd25fae9600d983ad61d2ff5bd873697eca9480","observation_id":"5761f58d-16d5-448b-9b94-5b221ebb6dd6","resolution":{"observed_at":"2026-08-06T17:59:09.968066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:06.292975Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.292975Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:e5795cb1653c1bd02cedcbb81f173744ddec567986946ee8c3bf2b83c10d1a2f","observation_id":"5ef67d07-a8dc-41dc-9d26-cb56b53ddcc9","resolution":{"observed_at":"2026-08-06T17:59:06.292975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06345","last_updated":"2025-07-18T13:42:38Z","snapshot_observed_at":"2026-08-09T15:50:32.768239Z","submitted_at":"2024-07-23T08:15:55Z","title":"Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review","version":2},"cited_work":{"arxiv_id":"2408.06345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.06345","snapshot_observed_at":"2026-08-06T17:59:07.903170Z","title":"Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review","venue":"cs.IR","work_id":"ba0a899b-d2a5-46f3-b893-b55322c30da9","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.366921Z"},"links":{"cited_paper":"/paper/2408.06345","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:659a19cf6e953f075809b538017d20749a30e8a66d46bd9ea91ab245d13489e9","observation_id":"f9c86612-5a36-4025-a683-38c90fd824d6","resolution":{"observed_at":"2026-08-06T17:59:07.936194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:09.195611Z","title":"Docile benchmark for document information localization and extraction","venue":null,"work_id":"9d42abac-e79d-4390-bec7-02c34a3a9fc9","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.430607Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:db22df80dff10614c31dfd4e0ba6449efd93b115cb5d9f73f8fcb69448d20e90","observation_id":"0450fa45-eb9f-42af-997c-a167f0ea5ae5","resolution":{"observed_at":"2026-08-06T17:59:09.303856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:06.508889Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.508889Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:7067785ae37dadbc8b937a49dec7f54f05d2ed85db1f00733362a64b145dcfab","observation_id":"4f4ff3ee-551a-480a-b2f8-3c623614cef3","resolution":{"observed_at":"2026-08-06T17:59:06.508889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14470","last_updated":"2021-03-26T13:46:00Z","snapshot_observed_at":"2026-07-06T10:53:40.529751Z","submitted_at":"2021-03-26T13:46:00Z","title":"Spatial Dual-Modality Graph Reasoning for Key Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14470","snapshot_observed_at":"2026-08-06T17:59:06.590430Z","title":"Spatial dual-modality graph rea- soning for key information extraction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.590430Z"},"links":{"cited_paper":"/paper/2103.14470","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:86f2474a7d1a5b235365d5300f6d1a68c5bcc625191c0e3b7c7af140ff0efebe","observation_id":"7927cf82-2d59-4f37-a184-cef2e104c169","resolution":{"observed_at":"2026-08-06T17:59:06.590430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.998435Z","title":"Instructdoc: A dataset for zero-shot general- ization of visual document understanding with instructions","venue":null,"work_id":"5d92231b-624e-42e0-ba79-c11222d3b384","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.674793Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:3c15ff9f056a73734199e61a7355e9055b187622ed66b811e4c50df42224ad9a","observation_id":"abe05721-78e1-4dea-a77f-29a5e9be424e","resolution":{"observed_at":"2026-08-06T17:59:09.108724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.826926Z","title":"Docllm: A layout-aware gener- ative language model for multimodal document understand- ing","venue":null,"work_id":"655906ea-2416-4674-ae46-b30ba181bb3b","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.763920Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:309cd903d8a2ab78cb5d69763e177dfb2820ffb4e335077242a6eaed65ef9ab5","observation_id":"1fda786d-7401-4228-913d-144790c9ec8e","resolution":{"observed_at":"2026-08-06T17:59:08.900312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.687226Z","title":"Vision-enhanced semantic entity recognition in document images via visually-asymmetric consistency learning","venue":null,"work_id":"dfad510c-8e7c-48ff-a6e1-66bf7227cb75","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.856658Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:6577b923979086b08c2dc4568d3504eb0cba0ffdb063f1614b0e1404c3c00bb9","observation_id":"93db90e9-a191-4f32-86b2-5df0d338957e","resolution":{"observed_at":"2026-08-06T17:59:08.765536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:59:06.956279Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:06.956279Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:7a226c48bd5150d6cbe371f1bb01a35ce34e355c483821c1f730183754041f34","observation_id":"9212ef6d-d603-452e-9f5f-855e5e9601d3","resolution":{"observed_at":"2026-08-06T17:59:06.956279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.474193Z","title":"Layoutlm: Pre-training of text and layout for document image understanding","venue":null,"work_id":"96b4be25-43d4-43d7-97e2-b669d681ab26","year":2020},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.028063Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:0129ecafa885b67a6bc1340f42b31fa67581b0e9b3a0b6fa6e406d26140891a3","observation_id":"6292d008-1c23-4547-8c70-31718d9802ac","resolution":{"observed_at":"2026-08-06T17:59:08.562604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.357174Z","title":"Layoutlmv2: Multi-modal pre-training for visually-rich document understanding","venue":null,"work_id":"187f8ac1-820a-4da4-b23f-89c2421a7584","year":2021},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.159523Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:298afc9f136821aa172b5808b0f83efbbf618eda593396c8c492e8715a8ad7c8","observation_id":"86758d95-0187-4e1b-bf58-47ca6d7d7f53","resolution":{"observed_at":"2026-08-06T17:59:08.414877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-06T17:59:07.342834Z","title":"mPLUG- DocOwl: Modularized multimodal LLM for document un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.342834Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:ab4fec46513f9e6bc7705d2719425c92339b89776a230e827a3b9c942e38ae5f","observation_id":"2454a794-357c-430c-9d0d-367ccdaf14d4","resolution":{"observed_at":"2026-08-06T17:59:07.342834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.213215Z","title":"UReader: Universal OCR-free visually-situated language understand- ing with multimodal large language model","venue":null,"work_id":"25f7060b-ed41-4972-ab9f-f4b1051ed024","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.428302Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:38a6cfc04ef9ff55bdbbc9e326eb6c8bede4d624c8971441b5a8e65d00a7753b","observation_id":"2c7ea86d-7888-4a3b-a0d7-2bf2eeb9d5ad","resolution":{"observed_at":"2026-08-06T17:59:08.280511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:59:08.071101Z","title":"By my eyes: Grounding multimodal large language models with sensor data via vi- sual prompting","venue":null,"work_id":"0da9d3fb-b088-427a-bb8d-dd66a8e2fa81","year":2024},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.466602Z"},"links":{"citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:f7d975bdc1fba1e96e791d0552875289d19246fdb2994523631d9b6c747ae47a","observation_id":"249d394c-c77b-4bbf-8550-f94411c7e77b","resolution":{"observed_at":"2026-08-06T17:59:08.118046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00289","last_updated":"2023-03-01T07:32:51Z","snapshot_observed_at":"2026-07-06T14:57:13.264945Z","submitted_at":"2023-03-01T07:32:51Z","title":"StrucTexTv2: Masked Visual-Textual Prediction for Document Image Pre-training","version":1},"cited_work":{"arxiv_id":"2303.00289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.00289","snapshot_observed_at":"2026-08-06T17:59:07.710727Z","title":"StrucTexTv2: Masked Visual-Textual Prediction for Document Image Pre-training","venue":"cs.CV","work_id":"40bf41cc-d8b6-4389-a123-6b7d0d9c7cb7","year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.531504Z"},"links":{"cited_paper":"/paper/2303.00289","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:9feaa4bb58e7d91914b55bcfdd69bd1d6e83b5bb9ca286aa9ae1a1d717cc3176","observation_id":"cd4dc51e-b3e7-4372-80dd-ac741b1daf00","resolution":{"observed_at":"2026-08-06T17:59:07.773014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T17:59:07.601054Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:07.601054Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.09531"},"observation_digest":"sha256:521c7abe7febd88b2393363de13e98c07311eaa0dbfbe798e214742c453e7dc2","observation_id":"1a888602-e291-42c8-9625-1461a92fcc8a","resolution":{"observed_at":"2026-08-06T17:59:07.601054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09531","last_updated":"2025-07-13T08:15:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:00:02.677398Z","submitted_at":"2025-07-13T08:15:11Z","title":"VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.09531."}