{"as_of":"2026-08-11T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1ac95c133e5f6e2f2e1cc2bcf3647d966e84a8b111cbfe1520c1b8546a94672","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:26.990881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:37:30.147692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-07T15:42:26.990881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-10T10:24:50.264465Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:26.990881Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:eb80d3b12a007c9c4b2a852a39d8c31fa444bbd2d89aa774aed5e0a6f7a1294d","observation_id":"4f8d34df-db08-49f0-9a62-eb1f29194697","resolution":{"observed_at":"2026-08-07T15:42:26.990881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-14T23:24:28.094041Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2507.05595"},"observation_digest":"sha256:a771d443600d03d595659dcdcaa5674a85af7f57d57add92550aabb16189b816","observation_id":"dc6b1429-fcc0-4f58-87ac-341cefcf2677","resolution":{"observed_at":"2026-05-14T23:24:28.327571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-07T12:10:18.495715Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19492","last_updated":"2025-05-31T02:35:38Z","snapshot_observed_at":"2026-08-07T12:04:49.777765Z","submitted_at":"2025-05-31T02:35:38Z","title":"ChartGen: Scaling Chart Understanding Via Code-Guided Synthetic Chart Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:18.495715Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2507.19492"},"observation_digest":"sha256:8869b0920cbbeafafde08e49ecb4f1fd50259e7d6782a93a3f70bd6584f5e447","observation_id":"02a6f8ee-4043-4f86-b4ad-8467fcba4c50","resolution":{"observed_at":"2026-08-07T12:10:18.495715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-05T10:52:13.940165Z","title":"and Staar, P.W.J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03615","last_updated":"2025-09-03T18:08:41Z","snapshot_observed_at":"2026-08-10T00:55:50.597562Z","submitted_at":"2025-09-03T18:08:41Z","title":"E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:52:13.940165Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2509.03615"},"observation_digest":"sha256:d6676b82c67916ced57c16d0fba595dc62cc571ffe40bb265b7c5659becf5653","observation_id":"059b3d4f-e097-489e-adee-4c8cced1226e","resolution":{"observed_at":"2026-08-05T10:52:13.940165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-05T14:20:25.170342Z","title":"Smoldocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.170342Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:6bf53f1f6935ec90a76e80b87edbb968baadea505908506f18d3bb9dd5789e70","observation_id":"0b8afe44-8a1a-46f0-bb21-6192ce1ac89a","resolution":{"observed_at":"2026-08-05T14:20:25.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-06T11:22:47.957500Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:3553849ffbf82733cadf06fe40854b4061df6af5f873d43907f02e6836127461","observation_id":"2243c99a-0e45-49f1-8fff-ddf6d83300a6","resolution":{"observed_at":"2026-05-17T13:25:32.028685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:50.647950Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2510.18234"},"observation_digest":"sha256:bd209b94dbed797068763c32dd1642fbf713abf0ea34cda4e1e917f67a2633e2","observation_id":"fd30d2fc-68a4-447b-be80-4c3bb7adff4b","resolution":{"observed_at":"2026-05-12T04:35:50.751259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-03T17:02:35.295207Z","title":"SmolDocling: An ultra-compact vision- language model for end-to-end multi-modal document con- version.arXiv preprint arXiv:2503.11576, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10888","last_updated":"2026-06-02T15:53:37Z","snapshot_observed_at":"2026-08-11T02:56:06.002543Z","submitted_at":"2025-12-11T18:19:00Z","title":"PubTables-v2: A new large-scale dataset for full-page and multi-page table extraction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:02:35.295207Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2512.10888"},"observation_digest":"sha256:657d2b1ab575829dacda796d65644c1ed59b204d31c8072a7c8ae6ccca9b9f3a","observation_id":"a8e5ba99-f8e0-4699-9f45-d7b49523c9b2","resolution":{"observed_at":"2026-08-03T17:02:35.295207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-03T14:16:50.805641Z","title":"Smoldocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion.arXivpreprintarXiv:2503.11576, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-09T11:14:25.937636Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:16:50.805641Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2512.21095"},"observation_digest":"sha256:30397cc37ff1529d9d68c9716dbf6c780730db9161ca15ea989c8f4726158991","observation_id":"1a8d3d5e-c9d9-4741-bad0-dea1ffb02914","resolution":{"observed_at":"2026-08-03T14:16:50.805641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-02T22:27:42.627628Z","title":"T., Kim, Y., Gurbuz, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16872","last_updated":"2026-05-27T14:51:57Z","snapshot_observed_at":"2026-08-10T14:44:30.822705Z","submitted_at":"2026-02-18T20:59:22Z","title":"DODO: Discrete OCR Diffusion Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T22:27:42.627628Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2602.16872"},"observation_digest":"sha256:60262dec67b78efc0013292b86451b53ee8f52a1508bf140cf078f5b332f077b","observation_id":"52ed26b1-3a17-4224-8537-68037e5b214d","resolution":{"observed_at":"2026-08-02T22:27:42.627628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2604.00161","last_updated":"2026-04-21T01:45:08Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T19:09:55Z","title":"Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:53.449935Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2604.00161"},"observation_digest":"sha256:241f2201be15ccfdaebef344c03b0241c241d6b20dec508c5b49ffa5353ece68","observation_id":"914ea71a-7da4-48d3-9742-7e72075b1ed7","resolution":{"observed_at":"2026-05-13T23:33:26.638872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2605.12623","last_updated":"2026-05-21T05:33:02Z","snapshot_observed_at":"2026-08-06T19:38:37.895679Z","submitted_at":"2026-05-12T18:09:38Z","title":"DocAtlas: Multilingual Document Understanding Across 80+ Languages","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-14T21:02:45.148167Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2605.12623"},"observation_digest":"sha256:2c32087ea7ebe18fcbcc5faab87abd16156dbee4c4a6b87d315f67ce73a38e9a","observation_id":"433cff05-eac4-4d32-b500-173a5f898e30","resolution":{"observed_at":"2026-05-14T21:02:58.627073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2605.18025","last_updated":"2026-05-18T08:14:49Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:14:49Z","title":"TeleCom-Bench: How Far Are Large Language Models from Industrial Telecommunication Applications?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T11:23:34.256279Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2605.18025"},"observation_digest":"sha256:6f2bf64b991ef5cdea8450608c59932fd2503b424d69c23f3e173f9e3c938c48","observation_id":"6db6664a-9a7e-45e2-93d5-55f7e1410f98","resolution":{"observed_at":"2026-05-20T11:28:14.663288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2605.19866","last_updated":"2026-05-19T13:58:24Z","snapshot_observed_at":"2026-08-03T21:16:40.817874Z","submitted_at":"2026-05-19T13:58:24Z","title":"Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:48:34.771799Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2605.19866"},"observation_digest":"sha256:446a3489ecc9569db4e4cd183cf7cd1597a94e3f7969d69f8122331c5be036b9","observation_id":"8ddd3b6c-0e70-4645-914d-c65499a583f2","resolution":{"observed_at":"2026-05-20T05:53:05.101834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":"2503.11576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-07-03T00:37:30.147692Z","title":"Said Gurbuz, Michele Dolfi, Miquel Farré, and Peter W","venue":null,"work_id":"35472745-6558-49bf-8eb3-cdcbb996350b","year":2025},"citing_paper":{"arxiv_id":"2606.09788","last_updated":"2026-06-08T17:43:44Z","snapshot_observed_at":"2026-08-10T18:51:19.161260Z","submitted_at":"2026-06-08T17:43:44Z","title":"POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T17:06:33.518620Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2606.09788"},"observation_digest":"sha256:4ac9034dda87eb7f841193c2908402475bd364ae08a536263a60fdae6b4d851c","observation_id":"2cf726a6-1fe4-4d53-b916-8553cd54bc25","resolution":{"observed_at":"2026-07-03T00:37:30.149616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.11576/citation-record","integrity":"/paper/2503.11576/integrity","json":"/paper/2503.11576/citation-record.json","paper":"/paper/2503.11576"},"outbound":[],"paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2503.11576."}