{"as_of":"2026-08-10T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1cad82fc44191620175d8e53b1575787b68c13d428f6adf37e3468180ebf43f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:43:20.711870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:50:57.891013Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":"2401.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2401.12503 (2024) 6, 9","venue":null,"work_id":"6b89ffbc-7c0c-491d-b376-55818b045e86","year":2024},"citing_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T20:50:57.814634Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2409.01704"},"observation_digest":"sha256:3776b4ac5857d8933f16c1a539b13b6b7766f95aca244aea6081a225879a522e","observation_id":"24c23946-3246-4124-a574-e50af50f122a","resolution":{"observed_at":"2026-05-17T20:50:57.893024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":"2401.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2401.12503 (2024) 6, 9","venue":null,"work_id":"6b89ffbc-7c0c-491d-b376-55818b045e86","year":2024},"citing_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T04:00:25.624430Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2409.18839"},"observation_digest":"sha256:fd3dbea30530f676c4a6669ad6feaa34d171003ce3dcd4701a050acc19ea00a2","observation_id":"13febeef-9dee-4a05-b0d8-7a3d425c0be9","resolution":{"observed_at":"2026-05-16T04:00:25.734905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-08-06T18:43:20.711870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-09T20:40:39.623259Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.711870Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:90f4178fdd724831705a8ea0f5059928a78646f4b978f82e7943c66d51e7d38b","observation_id":"b8c558e9-a200-4c3d-994c-2ab58b37d8ff","resolution":{"observed_at":"2026-08-06T18:43:20.711870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-08-06T18:28:13.265287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08309","last_updated":"2025-07-11T05:02:06Z","snapshot_observed_at":"2026-08-09T20:40:52.731098Z","submitted_at":"2025-07-11T05:02:06Z","title":"Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:28:13.265287Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2507.08309"},"observation_digest":"sha256:c6b4ca4ca39b44776af88051d2f9d7851b2fd86341f28aed511ef84bbf0d1e6d","observation_id":"b4e7c7a1-35e5-44da-a333-047ebd264d65","resolution":{"observed_at":"2026-08-06T18:28:13.265287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":"2401.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2401.12503 (2024) 6, 9","venue":null,"work_id":"6b89ffbc-7c0c-491d-b376-55818b045e86","year":2024},"citing_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:50.647950Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2510.18234"},"observation_digest":"sha256:37676bb1468d8ff76c5e7dd9f48419fdd661e865749103aa06b23bd1e19880e0","observation_id":"ad6df10f-0dde-43be-a795-6c860e8d1d9c","resolution":{"observed_at":"2026-05-12T04:35:50.781638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12503","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2401.12503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2401.12503","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:25d3e998ed6139eefdb88bc168a6f2f6995e950a9d0a156dcdd8bf17ea4a7183","observation_id":"3a90bb10-7cdd-45c0-a05a-0826648174a3","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.12503/citation-record","integrity":"/paper/2401.12503/integrity","json":"/paper/2401.12503/citation-record.json","paper":"/paper/2401.12503"},"outbound":[],"paper":{"arxiv_id":"2401.12503","last_updated":"2024-01-23T05:55:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T03:32:53.706719Z","submitted_at":"2024-01-23T05:55:26Z","title":"Small Language Model Meets with Reinforced Vision Vocabulary"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2401.12503."}