{"as_of":"2026-08-17T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c4049b054c90e20a014c5b6056c6ab0bd4967eded0ceb20af9d5a0217d20b25","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:44:17.303248Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:04:30.042864Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.063058Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2604.02692","last_updated":"2026-04-03T03:36:36Z","snapshot_observed_at":"2026-08-11T07:17:57.452687Z","submitted_at":"2026-04-03T03:36:36Z","title":"Parser-Oriented Structural Refinement for a Stable Layout Interface in Document Parsing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:44.073353Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2604.02692"},"observation_digest":"sha256:7ebfed00fd00bff041c25ca75c3d2e571c89b093cbfe89ac3a8d5663d2c995e6","observation_id":"61e47448-70da-49d5-b4cd-2472b57d0468","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2604.04771","last_updated":"2026-04-09T09:16:34Z","snapshot_observed_at":"2026-08-12T11:17:57.847430Z","submitted_at":"2026-04-06T15:44:18Z","title":"MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:58:41.377996Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2604.04771"},"observation_digest":"sha256:fbaaf47bfba5614f2c5717372c37ad6062edeccc76608c019c95f432ed62f96f","observation_id":"4d1387c1-c444-482a-916d-cd38102058a3","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2605.07492","last_updated":"2026-05-08T09:30:31Z","snapshot_observed_at":"2026-08-10T21:40:06.999198Z","submitted_at":"2026-05-08T09:30:31Z","title":"How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:28:02.152600Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2605.07492"},"observation_digest":"sha256:2125abcbd17bf4958d5ceb7889790f499cc08fdeacaea73f3b8724bedca16288","observation_id":"14021d59-1781-42f0-a013-106d9dd5b04b","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2605.22100","last_updated":"2026-05-28T08:19:59Z","snapshot_observed_at":"2026-08-16T14:14:23.008482Z","submitted_at":"2026-05-21T07:36:41Z","title":"MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T05:58:04.055855Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2605.22100"},"observation_digest":"sha256:911ca881e851d1561f46810b41dec7cd2212db0d6cb2b89ec0e3e6945d49fc53","observation_id":"612e5ec8-f733-4f38-9cd7-72c37d730f45","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2605.22100","last_updated":"2026-05-28T08:19:59Z","snapshot_observed_at":"2026-08-16T14:14:23.008482Z","submitted_at":"2026-05-21T07:36:41Z","title":"MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T17:37:33.750306Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2605.22100"},"observation_digest":"sha256:3420ec8788ac3c1de8a1d2f9d9acd205ac34dd296165029561dd686787c1cfed","observation_id":"37772d44-a626-4a8f-a5ea-4be6664445b9","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2605.27978","last_updated":"2026-05-27T05:16:21Z","snapshot_observed_at":"2026-08-13T01:21:58.936928Z","submitted_at":"2026-05-27T05:16:21Z","title":"ABot-OCR Technical Report","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:17.221676Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2605.27978"},"observation_digest":"sha256:22602df7cec579b88a346c9d7ee66707f843f7d91d6d065b5b40a6b48497a4bd","observation_id":"762ba601-85d9-4e7e-b9f2-a7bf8e3e97f4","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2606.03264","last_updated":"2026-06-02T07:27:03Z","snapshot_observed_at":"2026-08-16T07:12:09.561259Z","submitted_at":"2026-06-02T07:27:03Z","title":"PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T10:39:14.444486Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2606.03264"},"observation_digest":"sha256:9c15a701940d67e4168a433acf230fa23a2b13fb6e6384ef785d541a7dc588f7","observation_id":"4de339ab-37c2-4da1-a298-ef31081c387f","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":"2601.20430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-07-14T03:21:27.323268Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":"a02d784c-999f-4b21-ab04-640335260827","year":2026},"citing_paper":{"arxiv_id":"2606.24447","last_updated":"2026-06-23T11:34:28Z","snapshot_observed_at":"2026-08-07T17:24:33.181681Z","submitted_at":"2026-06-23T11:34:28Z","title":"P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T00:18:07.278889Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2606.24447"},"observation_digest":"sha256:6cd569d39d3460c509718815f1cdaaa347b7e982b2ab4d21f6191010bcced012","observation_id":"deaf8128-b58e-4a3a-8ac9-94642f1e2005","resolution":{"observed_at":"2026-07-14T03:21:27.323268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-08-02T04:40:04.566211Z","title":"Youtu-Parsing: Perception, structuring and recognition via high-parallelism decoding.arXiv preprint arXiv:2601.20430, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13639","last_updated":"2026-07-15T09:32:33Z","snapshot_observed_at":"2026-08-16T13:28:09.830132Z","submitted_at":"2026-07-15T09:32:33Z","title":"OvisOCR2 Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T04:40:04.566211Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2607.13639"},"observation_digest":"sha256:31eb6ec51f368576f5fcff85a27d84cd12a6d41b558cf5ac4f184a52bc9a0298","observation_id":"647786e6-5233-4b77-b337-d1e8c995a3c0","resolution":{"observed_at":"2026-08-02T04:40:04.566211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-08-01T14:16:08.107522Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18839","last_updated":"2026-07-21T08:25:32Z","snapshot_observed_at":"2026-08-14T06:42:42.759580Z","submitted_at":"2026-07-21T08:25:32Z","title":"HPD-Parsing: Hierarchical Parallel Document Parsing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:16:08.107522Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2607.18839"},"observation_digest":"sha256:3bfab7fbf55fa0cac84f23e713af00b2c0989cda4f92ca0df7c0da25fcb6689e","observation_id":"b96afe7f-78f9-4bf8-98cb-7c7211102b1c","resolution":{"observed_at":"2026-08-01T14:16:08.107522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20430","snapshot_observed_at":"2026-08-15T21:04:30.042864Z","title":"Youtu-parsing: Perception, structuring and recognition via high-parallelism decoding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12898","last_updated":"2026-08-13T07:34:21Z","snapshot_observed_at":"2026-08-16T23:11:14.777526Z","submitted_at":"2026-08-13T07:34:21Z","title":"NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:04:30.042864Z"},"links":{"cited_paper":"/paper/2601.20430","citing_paper":"/paper/2608.12898"},"observation_digest":"sha256:f3fad466a7e6e86ef9b388a869cbf9cbbf4badf5137c101547076fb4db997899","observation_id":"df24d726-cb6d-4f2f-a3ab-c6b587dd6f62","resolution":{"observed_at":"2026-08-15T21:04:30.042864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.20430/citation-record","integrity":"/paper/2601.20430/integrity","json":"/paper/2601.20430/citation-record.json","paper":"/paper/2601.20430"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-08-15T04:34:24.922843Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21169","snapshot_observed_at":"2026-08-15T15:44:16.966655Z","title":"Document parsing unveiled: Techniques, challenges, and prospects for structured information extraction.arXiv preprint arXiv:2410.21169, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:16.966655Z"},"links":{"cited_paper":"/paper/2410.21169","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:d2ffe4e78a554e95d32b515749fe72d016e0f8b80a9f5c8d382034e8ae7641fb","observation_id":"c3c7fcfe-c610-41ab-8f3a-4820dd6cf184","resolution":{"observed_at":"2026-08-15T15:44:16.966655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-14T18:47:58.220615Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14059","snapshot_observed_at":"2026-08-15T15:44:16.973324Z","title":"Dolphin: Document image parsing via heterogeneous anchor prompting.arXiv preprint arXiv:2505.14059, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:16.973324Z"},"links":{"cited_paper":"/paper/2505.14059","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:86c2298c60fd7aca1b23e51258ef4aeb262ef041b089027d3fd5287c6d1063c8","observation_id":"28aecddb-10c8-4960-a858-eb33f6df49bb","resolution":{"observed_at":"2026-08-15T15:44:16.973324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:16.978948Z","title":"Monkeyocr: Document parsing with a structure-recognition-relation triplet paradigm.arXiv preprint arXiv:2506.05218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:16.978948Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:9f4d04c9b6385ebf2696bb81fef4d55b5e5ad234d0d0505e62903273527b2dbd","observation_id":"2b1f6253-d19b-407b-aaa4-221515c6d48a","resolution":{"observed_at":"2026-08-15T15:44:16.978948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-08-14T02:54:31.558222Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-15T15:44:16.984659Z","title":"Mineru: An open-source solution for precise document content extraction.arXiv preprint arXiv:2409.18839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:16.984659Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:98d50519dbcd5a19c1242cd96e579da623bd96f44b2dc768887f3b80cf0ec209","observation_id":"38bc556d-76f8-4df6-bfcf-fa4f878dfe24","resolution":{"observed_at":"2026-08-15T15:44:16.984659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:16.990144Z","title":"olmocr: Unlocking trillions of tokens in pdfs with vision language models.arXiv preprint arXiv:2502.18443, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:16.990144Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:12671e11a7531a071547001b85b2fb7b4e2045c383fc99321d461de0361ec8d5","observation_id":"fbd59e9a-c7e3-48f3-87a6-bd58f72aaca8","resolution":{"observed_at":"2026-08-15T15:44:16.990144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:16.995462Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:16.995462Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:778cf5e69cbfd93e3be015cd3c799fa276efa7d64cc49d2dd0d3422e84ff8aec","observation_id":"4fb521d5-2558-4cef-b695-bda64cd4e81d","resolution":{"observed_at":"2026-08-15T15:44:16.995462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-15T07:34:12.195990Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22186","snapshot_observed_at":"2026-08-15T15:44:17.001936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.001936Z"},"links":{"cited_paper":"/paper/2509.22186","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:795c4b8d3494327bd208ff64b35ec9f1e3cdaca410b6d842ccb8a04d09664e61","observation_id":"65178962-49ea-4845-b8ee-059fc51e11d0","resolution":{"observed_at":"2026-08-15T15:44:17.001936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.008593Z","title":"Paddleocr-vl: Boosting multilingual document parsing via a 0.9 b ultra-compact vision-language model.arXiv preprint arXiv:2510.14528, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.008593Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:d8fde90e4885ce02bb7528350a66e05028ea918f98e9f803ac7da2f213952bd8","observation_id":"81b97e13-f7cb-4139-a7dd-3ea4ed262be7","resolution":{"observed_at":"2026-08-15T15:44:17.008593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.013892Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.013892Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:0db0325f130cabbc8ffde21f826b9e8774120f1faed17304af36e8aa22e0c105","observation_id":"51db00ed-ed1d-40a9-8942-9d9547d83dc7","resolution":{"observed_at":"2026-08-15T15:44:17.013892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T15:44:17.018994Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.018994Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:c7de7d207cb7ee536b04dff0f8b70d7d24401833e5b95dfb8140f4bb587d3a55","observation_id":"6407f825-1915-4392-a1de-1b8e9630142b","resolution":{"observed_at":"2026-08-15T15:44:17.018994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T15:44:17.025501Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.025501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:3f3275bf6c2ccdac5ceedd991b88a1770080126c6e5602b849bd6a4b049d5be6","observation_id":"f82d6265-c768-4184-a7f5-7700df801663","resolution":{"observed_at":"2026-08-15T15:44:17.025501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T15:44:17.031620Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.031620Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:b5d85bad6e513ea41a90c0c5a334ef134c5f5762fcb78e3e988881f6af93722d","observation_id":"c5043f4b-ba09-4296-bdae-802a4c47b9cc","resolution":{"observed_at":"2026-08-15T15:44:17.031620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T15:44:17.038573Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.038573Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:d6d5f623633e1e538f3dd462c8fffa3d0a66af5bf2b1dade420e0fbb72182f80","observation_id":"800a5e75-8673-4c26-9d98-870939a307e0","resolution":{"observed_at":"2026-08-15T15:44:17.038573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.044069Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.044069Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:b4c623e7c3332762f1e6f6399551f21b21e3fc9bf42b529ea8ea4a0924a5114a","observation_id":"e0258661-845a-4506-8560-49e6f5284cef","resolution":{"observed_at":"2026-08-15T15:44:17.044069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.049410Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.049410Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:3f6408516f282c469252aa12d00de912fb4f04692efe53a2d7fdb064eb9fb194","observation_id":"ca900daa-7c5c-4724-b9db-1b983b302a36","resolution":{"observed_at":"2026-08-15T15:44:17.049410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T15:44:17.056152Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.056152Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:def5364fa4f2228e5a328c1fc509c1a5c73fff282e59478fbea34c134b40fe8c","observation_id":"1c583a0e-1b4d-4f34-9e07-a2e25a7241fd","resolution":{"observed_at":"2026-08-15T15:44:17.056152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.062657Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.062657Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:e9ab476d1f84ac183c9d41851c750ca1d4360748e77c88504c9ef7feffe9c43b","observation_id":"14265ea9-2609-4393-8036-c816c782a320","resolution":{"observed_at":"2026-08-15T15:44:17.062657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-15T15:44:17.068839Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.068839Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:f42b646e7bf9183d3060b94790bc647ed08973bb756c004f7d43a1a5812ecc3f","observation_id":"275bff2b-0528-4d99-a769-5016c2a45a4c","resolution":{"observed_at":"2026-08-15T15:44:17.068839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-08-14T05:24:51.715708Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-08-15T15:44:17.075783Z","title":"Paddleocr 3.0 technical report.arXiv preprint arXiv:2507.05595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.075783Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:59c2b740e23de94d8e93d2bb3eac8bbe69b0ac105d4f113edc55a3c008d5ea0e","observation_id":"8fdd8404-4467-4ca7-9efb-94bc36cf75f3","resolution":{"observed_at":"2026-08-15T15:44:17.075783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17887","last_updated":"2025-01-27T19:40:00Z","snapshot_observed_at":"2026-08-15T15:32:18.722307Z","submitted_at":"2025-01-27T19:40:00Z","title":"Docling: An Efficient Open-Source Toolkit for AI-driven Document Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17887","snapshot_observed_at":"2026-08-15T15:44:17.083690Z","title":"Docling: An efficient open- source toolkit for ai-driven document conversion.arXiv preprint arXiv:2501.17887, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.083690Z"},"links":{"cited_paper":"/paper/2501.17887","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:45f232eaf979e79920bd43f3f49d84015031dab9ee587f26c46c04b88f68aa5b","observation_id":"abf9538b-1101-4abd-96e1-a9471f9bf8e9","resolution":{"observed_at":"2026-08-15T15:44:17.083690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-08-17T02:37:33.939393Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-15T15:44:17.088989Z","title":"Deepseek-ocr: Contexts optical compression.arXiv preprint arXiv:2510.18234, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.088989Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:a7f61135233fcdbd40c77dfba95ef5a91c6a4537a1c5f41b218f08214c0ce5fa","observation_id":"021ed39c-3c1f-4c42-8cc1-66a02c9bd9d1","resolution":{"observed_at":"2026-08-15T15:44:17.088989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05165","last_updated":"2020-06-09T10:12:16Z","snapshot_observed_at":"2026-07-30T16:20:25.926560Z","submitted_at":"2020-06-09T10:12:16Z","title":"Learning to Recover from Multi-Modality Errors for Non-Autoregressive Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05165","snapshot_observed_at":"2026-08-15T15:44:17.094994Z","title":"Learning to recover from multi-modality errors for non-autoregressive neural machine translation.arXiv preprint arXiv:2006.05165, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.094994Z"},"links":{"cited_paper":"/paper/2006.05165","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:fdc4f17459a9492886edeff98d2c5301d462d741e2de056d39a031ee126c8373","observation_id":"265ca862-3f02-4b68-841b-abaf3cf10b11","resolution":{"observed_at":"2026-08-15T15:44:17.094994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.892277Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"26257ccb-d0c6-4314-be90-faf799d2542f","year":2022},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.099950Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:3343dcf32bdf7fbb7345f2d4c826ad5e6ddd4aaee877b1ffc029f2d5ec592f88","observation_id":"00b3ea6c-2fb6-4c2a-b774-495dd3199179","resolution":{"observed_at":"2026-08-15T15:44:18.902835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-15T15:44:17.104779Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads.arXiv preprint arXiv:2401.10774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.104779Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:a465ffdff879ef16580a6667c0ed3f02a78171b30bf9f51a7b96f32548dabac1","observation_id":"350c4962-09c2-4acf-8802-8d1c8442f4bd","resolution":{"observed_at":"2026-08-15T15:44:17.104779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.109878Z","title":"Youtu-vl: Unleashing visual potential via unified vision-language supervision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.109878Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:cfbb0b7c441632ddf1c913cb5840707befba00aa5d162b0d27284c9211c78ca8","observation_id":"9057952b-921e-4f8e-ac46-f468fe359c36","resolution":{"observed_at":"2026-08-15T15:44:17.109878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.114650Z","title":"Youtu-llm: Unlocking the native agentic potential for lightweight large language models.arXiv preprint arXiv:2512.24618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.114650Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:dbf9e2a0f0d5e1edf374c9806803608b239e25c9460509da1ce9cd6e833a730d","observation_id":"5c4cca28-a230-4bb3-a035-9d3ad42778c6","resolution":{"observed_at":"2026-08-15T15:44:17.114650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.119434Z","title":"Optimized table tokenization for table structure recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.119434Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:41de7c1cd38de96580a344f358c904d5f52192a645b8a6194b577d31dd06027a","observation_id":"0ea370fd-202a-4d56-b225-e05a196ee111","resolution":{"observed_at":"2026-08-15T15:44:17.119434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:44:17.124389Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.124389Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:641c1aa4604544f668354a00d7ba9ef8c9c80e6962be592bbb14eddae43b7c31","observation_id":"7db0fe3b-5fcf-4d01-aa20-ee8c4d0f55e0","resolution":{"observed_at":"2026-08-15T15:44:17.124389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.129841Z","title":"Omnidocbench: Benchmarking diverse pdf document parsing with comprehensive annotations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.129841Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:014a688d7332d0c19da79860d4ef0e7f55ca5370fdc783d456847841a9b809a8","observation_id":"a62de1df-af5b-440c-b49a-a0d43f451c13","resolution":{"observed_at":"2026-08-15T15:44:17.129841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.840759Z","title":"Marker.https://github.com/datalab-to/marker, 2025","venue":null,"work_id":"e794cc26-f235-4c02-b59d-fee8dabd80ee","year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.134934Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:dbfdaf22a42815f510bb1222809d18bafe53566b6495f3c2a77b30b6cca4ffd4","observation_id":"398feac7-ff3d-45e3-8f67-2da3619ec8de","resolution":{"observed_at":"2026-08-15T15:44:18.846582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T15:44:17.140395Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.140395Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:90e529ab77b01a6a20884c16faae5542fd9a867e614e8b804b099e7eab19c2ea","observation_id":"cfb6dc25-7455-4cb2-b3a5-8a114ff93372","resolution":{"observed_at":"2026-08-15T15:44:17.140395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-16T11:21:33.397874Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T15:44:17.145667Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.145667Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:ace70d59e3d9c1803bf4c05697479ac0c9d0d2bcc750a363481f085597dace32","observation_id":"913246a2-824c-438a-867a-78f96aa42f9b","resolution":{"observed_at":"2026-08-15T15:44:17.145667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T15:44:17.156679Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.156679Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:f553b56c5a11a6dbceeeeef717268f16c817311f82dfdf7d52f6832f8df41505","observation_id":"5c7a5446-4ce2-4536-99ff-060339556d2b","resolution":{"observed_at":"2026-08-15T15:44:17.156679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T15:44:17.162018Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.162018Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:610125f600f2085aa46e24c7789bdf74a253880bb92d0e4e1ff15592a5ae5c2b","observation_id":"68e6045e-c5eb-48e3-8263-934d9cfab531","resolution":{"observed_at":"2026-08-15T15:44:17.162018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.819148Z","title":"Ocrflux.https://github.com/chatdoc- com/OCRFlux, 2025","venue":null,"work_id":"3f52b7ba-e3b1-4519-8230-f22a8eab4b12","year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.167479Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:2b34dd1af79034539d92b3d24288a56fae88f56c5f7030ece3050f769202188b","observation_id":"f2c7bcfa-27b1-4a28-9681-d38efc63ea09","resolution":{"observed_at":"2026-08-15T15:44:18.828056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.801128Z","title":"Mistral-ocr.https://mistral.ai/news/mistral-ocr?utm source=ai-bot.cn, 2025","venue":null,"work_id":"c21b1cfe-7924-49df-a115-54017d1a40b3","year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.175157Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:ceaa131435fc39870f5269871dec8bcd7403a9ebba05f0829ee2c209cdd98309","observation_id":"95e24531-f5e0-49de-b1ab-ac01fc966a01","resolution":{"observed_at":"2026-08-15T15:44:18.806663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.782621Z","title":"Points-reader: Distillation-free adaptation of vision-language models for document conversion","venue":null,"work_id":"a224a480-9862-4b14-8953-d7f358f87ae9","year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.182344Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:396265b7c54a1d410c25cb5dfc4116d4734074b9ad8d9446bba007d0d3ea9616","observation_id":"b413d709-e95d-4c19-8996-3c5e53901baa","resolution":{"observed_at":"2026-08-15T15:44:18.788674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.187713Z","title":"Nanonets-ocr-s: A model for transforming documents into structured markdown with intelligent content recognition and semantic tagging, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.187713Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:e35e06d712fff700402592a03ce5a07dcb4d6811b3beace0d753e05b50367385","observation_id":"8f6593be-c8f6-4088-a3b5-7443e6954bbb","resolution":{"observed_at":"2026-08-15T15:44:17.187713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.192599Z","title":"Image over text: Transforming formula recognition evaluation with character detection matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.192599Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:ee8ac109a994e6b767b58fd8605d57a95b1b8a9b31f66c6466bb5dad3edeaf6b","observation_id":"584ac40b-b000-43d9-9c34-e88a801f4b7b","resolution":{"observed_at":"2026-08-15T15:44:17.192599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-15T15:44:17.198748Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.198748Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:6fd1e87a03f325c8fd9e60ce84e40b9e8469c0950ba5c04c75cd2c3f2ee1e830","observation_id":"8374201a-4916-4d89-8531-ceb6b2fd6130","resolution":{"observed_at":"2026-08-15T15:44:17.198748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.738081Z","title":"Google deepmind","venue":null,"work_id":"ffe795b4-ca3a-4492-98b8-aabc6680c0ab","year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.204307Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:369c6964cd0c128b0f0b991038cb241be66dfda55e214ed89e4fa294f06e199d","observation_id":"bfa9869d-5c7f-479b-ab76-594a6deb129d","resolution":{"observed_at":"2026-08-15T15:44:18.743820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.209052Z","title":"Cc-ocr: A comprehensive and challenging ocr benchmark for evaluating large multimodal models in literacy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.209052Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:3109dfcba7a5e66212df2490a355de684d45d36a5046419e3a5ba44c2edce154","observation_id":"f6f2c98a-57ea-4267-bbb0-7efbdebe247d","resolution":{"observed_at":"2026-08-15T15:44:17.209052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-15T15:44:17.214122Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning.arXiv preprint arXiv:2501.00321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.214122Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:70ddd81ca8337152224560d3ef8d2ed35f64f8efaf02186d01f2f954215f9132","observation_id":"4099a557-3283-4f1b-a3ea-7496250d29b4","resolution":{"observed_at":"2026-08-15T15:44:17.214122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T15:44:17.219209Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.219209Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:053c2dbbf8f7980960448651757a347cd4d8ab9ff42c519ac046a2cc2fada036","observation_id":"a96d7866-464b-4bde-99bc-dc0f3ea305eb","resolution":{"observed_at":"2026-08-15T15:44:17.219209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.706628Z","title":"Onechart: Purify the chart structural extraction via one auxiliary token","venue":null,"work_id":"cdf2e6a8-7426-475a-9b7e-a20b82fc97cd","year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.225007Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:fac57829d6424c9f6045ce8e59f3fa30f5decea6391fc193dd4f417939bf06fe","observation_id":"f1107f11-8a7f-4d10-bf80-4c163b796c7f","resolution":{"observed_at":"2026-08-15T15:44:18.712573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.230016Z","title":"Deplot: One-shot visual language reasoning by plot-to-table translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.230016Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:8dd80cbf6f129a26ec777b90b6b62bdabd65b8095441b8e76e94073805889907","observation_id":"30f9e1a3-1ad4-458e-a7e2-ab5c0f8f3d14","resolution":{"observed_at":"2026-08-15T15:44:17.230016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12628","last_updated":"2024-10-16T14:50:47Z","snapshot_observed_at":"2026-08-16T13:08:47.127749Z","submitted_at":"2024-10-16T14:50:47Z","title":"DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12628","snapshot_observed_at":"2026-08-15T15:44:17.234986Z","title":"Doclayout-yolo: Enhancing document layout analysis through diverse synthetic data and global-to-local adaptive perception.arXiv preprint arXiv:2410.12628, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.234986Z"},"links":{"cited_paper":"/paper/2410.12628","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:bba195fc1d82b365df9a4610f988011307454395bff648c27be36b6c5d224df6","observation_id":"8eea3c0f-5258-4300-ad5b-07682ca6ffc8","resolution":{"observed_at":"2026-08-15T15:44:17.234986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17213","last_updated":"2025-03-21T15:20:47Z","snapshot_observed_at":"2026-08-16T12:47:55.547555Z","submitted_at":"2025-03-21T15:20:47Z","title":"PP-DocLayout: A Unified Document Layout Detection Model to Accelerate Large-Scale Data Construction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17213","snapshot_observed_at":"2026-08-15T15:44:17.241605Z","title":"Pp-doclayout: A unified document layout detection model to accelerate large-scale data construction.arXiv preprint arXiv:2503.17213, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.241605Z"},"links":{"cited_paper":"/paper/2503.17213","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:7b60360052aca6cb1886c6d1514fb5bf87b5f52b84b3ccf3c9be522a861772cd","observation_id":"a14a9b06-33ef-441e-83ad-40e11c6b45b9","resolution":{"observed_at":"2026-08-15T15:44:17.241605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.669600Z","title":"An end-to-end formula recognition method integrated attention mechanism.Mathematics, 11(1):177, 2022","venue":null,"work_id":"b57d9d62-c50b-4c7c-b1a0-e4956da9a709","year":2022},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.247926Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:b72c84507a0845b800a7a1786cdf75a5694dac6ffed1d0c12f650c6b7f5ebe09","observation_id":"14057ee5-a041-4c7e-9f4f-bd9396fddfaa","resolution":{"observed_at":"2026-08-15T15:44:18.677116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.649435Z","title":"Deeptabstr: Deep learning based table structure recognition","venue":null,"work_id":"24a7e605-46d9-4c43-868d-52e57b5768bf","year":2019},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.252678Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:901e5c7d9891774f73f67134ef14ff87e9ec11983d8cd4d24505c0c284b55c0e","observation_id":"212bb3d0-dab3-411c-8a86-64b1792ab6bb","resolution":{"observed_at":"2026-08-15T15:44:18.655210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:18.628355Z","title":"Tsrformer: Table structure recognition with transformers","venue":null,"work_id":"ade41819-e95c-4084-ae99-cfdeba80c4b6","year":2022},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.257609Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:978f98e52649ce90216ed4f3fcae01871adf353de879930492e3d89d27df999a","observation_id":"bd2b6cff-7e5e-4652-98ed-4fea655bfc79","resolution":{"observed_at":"2026-08-15T15:44:18.636070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11591","last_updated":"2021-08-27T04:56:07Z","snapshot_observed_at":"2026-08-16T18:00:52.754908Z","submitted_at":"2021-08-26T05:52:32Z","title":"LayoutReader: Pre-training of Text and Layout for Reading Order Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.11591","snapshot_observed_at":"2026-08-15T15:44:17.262939Z","title":"Layoutreader: Pre-training of text and layout for reading order detection.arXiv preprint arXiv:2108.11591, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.262939Z"},"links":{"cited_paper":"/paper/2108.11591","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:68e46a0ef3592380fbf102901246d181967cfb001939d89808ce0f7fe0130861","observation_id":"b595229f-2acc-4f99-9f13-5109d8aec9c5","resolution":{"observed_at":"2026-08-15T15:44:17.262939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:44:17.268807Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.268807Z"},"links":{"citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:c762903f47ea3ceeeb46e4cd837c3e68c24828209f022860d340f34c7ad6f770","observation_id":"4fcce5de-9d68-4abf-8115-01f9643393c4","resolution":{"observed_at":"2026-08-15T15:44:17.268807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T15:44:17.273912Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.273912Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:3ccf3e81e2525bc2871eaae83bc60604b0b2c4ac046d5c561bd04f8b74a16b1a","observation_id":"2e234018-d416-4158-b7d6-81971bb6d02a","resolution":{"observed_at":"2026-08-15T15:44:17.273912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-15T15:44:17.281082Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.281082Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:5e47fa2eb6cf6262f8013aebfae9b2b80a38d67819d8a7a7ce0b657dc5e625b0","observation_id":"f5e87724-d7ac-4577-a0f1-a91f5910cb38","resolution":{"observed_at":"2026-08-15T15:44:17.281082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T15:44:17.286792Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.286792Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:c7c91ee67f04a1cef31d4dfc07fbbaea094b55158d95324ac31ef0a7acc46d9a","observation_id":"750da50b-33ec-435e-af67-dd38fc66f501","resolution":{"observed_at":"2026-08-15T15:44:17.286792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-15T15:44:17.292277Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency.arXiv preprint arXiv:2508.18265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.292277Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:1efd08cd4a758b54a586d698db2f7e3f6ea904ccff9051a18d891b2a0f2c8378","observation_id":"00200826-4b3e-483b-b981-c59b066324db","resolution":{"observed_at":"2026-08-15T15:44:17.292277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T15:44:17.297182Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.297182Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:39fda68c5fb3000ee7c90cf54df8526c8e3125f1207891d6442111df0105d560","observation_id":"083a24fa-adc3-4c80-b1a8-0e3dde525d6b","resolution":{"observed_at":"2026-08-15T15:44:17.297182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T15:44:17.303248Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:44:17.303248Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2601.20430"},"observation_digest":"sha256:cf39cce5b851f2d7bf0ef16f6fb6ed7bfd2f2698ad9952810cadc631cafb290e","observation_id":"08c702be-99a7-495c-a07a-1c7fdcfdcdce","resolution":{"observed_at":"2026-08-15T15:44:17.303248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.20430","last_updated":"2026-07-13T14:16:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T15:37:06.142564Z","submitted_at":"2026-01-28T09:37:13Z","title":"Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 11 inbound Pith citation observations for arXiv:2601.20430."}