{"as_of":"2026-08-10T14:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4eabadbb02a2a18404be7b7afa59025a67a0f1b7978f0c2b02430c5b86cd2b1e","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:20:26.273267Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04469/citation-record","integrity":"/paper/2509.04469/integrity","json":"/paper/2509.04469/citation-record.json","paper":"/paper/2509.04469"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03801","last_updated":"2025-06-04T10:12:09Z","snapshot_observed_at":"2026-08-10T04:12:11.713480Z","submitted_at":"2025-06-04T10:12:09Z","title":"From Theory to Practice: Real-World Use Cases on Trustworthy LLM-Driven Process Modeling, Prediction and Automation","version":1},"cited_work":{"arxiv_id":"2506.03801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03801","snapshot_observed_at":"2026-08-05T14:20:28.224755Z","title":"From Theory to Practice: Real-World Use Cases on Trustworthy LLM-Driven Process Modeling, Prediction and Automation","venue":"cs.SE","work_id":"83e7efb8-4cc4-43bc-ba23-fbc9849d8845","year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.118070Z"},"links":{"cited_paper":"/paper/2506.03801","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:a4c8806cc15008e47005d842475f7f4fa206392749bd266a96562bb9129d89d4","observation_id":"a8c3042f-6252-44b7-8a55-71f5ec398a58","resolution":{"observed_at":"2026-08-05T14:20:28.336247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:31.401824Z","title":"Towards automated auditing with machine learning,","venue":null,"work_id":"64a30b8b-8604-40d4-b331-f62079a760de","year":2019},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.226947Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:621535446bd9986ce3c79d6cef5071cff4c1bb42ac94f9586e27d392ec40bd53","observation_id":"5a4f03fa-640c-45c2-9896-a7fbdbc26a68","resolution":{"observed_at":"2026-08-05T14:20:31.555716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:31.164859Z","title":"Advancing risk and quality assurance: A rag chatbot for improved regulatory compliance,","venue":null,"work_id":"77dac4ae-8a14-440f-a6d8-49cc8e5c334a","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.386519Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:70ae10bd9b7b96bd87f997c5f0bb5c5cd62d7bbbc364a2a63cb90370385c1f99","observation_id":"c881b657-495f-4979-ab75-5612ad701b3c","resolution":{"observed_at":"2026-08-05T14:20:31.274844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.869303Z","title":"Fine-tuning large language models for compliance checks,","venue":null,"work_id":"707847f3-478b-4e74-be72-a9d5e33831ab","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.486011Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:a9bd6f697763d84d42a507924d14e4aa69150fce9174e8bb5f5151d2c95b35c8","observation_id":"d3fd2493-b4f4-4333-bbf0-38a0d62f60d7","resolution":{"observed_at":"2026-08-05T14:20:31.033404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.601270Z","title":"An overview of data extraction from invoices,","venue":null,"work_id":"3c4f747e-2e0b-47f0-b22c-b431c26e763c","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.624840Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:a9b2e97db38a060ad4e45c10235d2ac6ffebb9614671d25919e594019a15a4bc","observation_id":"bb6c00df-3c0b-4bb5-9eda-4d0ee44c3118","resolution":{"observed_at":"2026-08-05T14:20:30.695448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13534","last_updated":"2021-02-04T23:48:39Z","snapshot_observed_at":"2026-08-07T03:26:44.455151Z","submitted_at":"2020-11-27T03:05:59Z","title":"A Survey of Deep Learning Approaches for OCR and Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13534","snapshot_observed_at":"2026-08-05T14:20:23.707156Z","title":"A survey of deep learning approaches for ocr and document understanding,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.707156Z"},"links":{"cited_paper":"/paper/2011.13534","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:c3703648c6a6103c630fc8ddf353bd45de5350165c13b2e149237c282de91fa0","observation_id":"a5f28a53-32a9-4176-afea-91452a2ba6fd","resolution":{"observed_at":"2026-08-05T14:20:23.707156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01287","last_updated":"2025-06-20T10:23:37Z","snapshot_observed_at":"2026-08-07T05:39:38.030448Z","submitted_at":"2024-08-02T14:19:34Z","title":"Deep Learning based Visually Rich Document Content Understanding: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01287","snapshot_observed_at":"2026-08-05T14:20:23.881572Z","title":"Deep learning based visually rich document content understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.881572Z"},"links":{"cited_paper":"/paper/2408.01287","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:4d03f5a9bd9300e066b99811c27701c3af1617ca2242ed95b682b1e9e8b8e8d2","observation_id":"a577dc6c-28e4-4526-bf59-61180c98fc14","resolution":{"observed_at":"2026-08-05T14:20:23.881572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.394142Z","title":"Memory-augmented agent training for business document understanding,","venue":null,"work_id":"1afcf5da-b208-4a12-9eaa-08fa6b73b681","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.050023Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:137c42775a9618f8e0ebee347b0374d2e2730f55fdce55d2aba4fd1df891e7fb","observation_id":"3f2573d4-a449-446b-831a-a0bee46287a9","resolution":{"observed_at":"2026-08-05T14:20:30.461236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.231851Z","title":"Wonderbread: A benchmark for evaluating multimodal foundation models on business process management tasks,","venue":null,"work_id":"b3c0e2b4-d7ca-4731-baf9-dbafb204f210","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.224802Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:940fe603101552595ee58c9cf2d03ddda70d5e63a9ec14c183226a76ed89622a","observation_id":"a025c8de-59a3-43eb-bcae-a02bba2427cf","resolution":{"observed_at":"2026-08-05T14:20:30.301934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:30.094689Z","title":"MMLONGBENCH-DOC: Benchmarking long-context document understanding with visualizations,","venue":null,"work_id":"776a67b2-e8d0-4357-9bcd-51065ba839ac","year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.436236Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:686cd0907e1fc491aa85090368f4ac45c7943269ca5bddda5bc3b2673cb7f582","observation_id":"8f82b2bb-18c4-4e96-9a2a-b11a4d3fad16","resolution":{"observed_at":"2026-08-05T14:20:30.148048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.899655Z","title":"M-longdoc: A benchmark for multimodal super- long document understanding and a retrieval-aware tuning framework,","venue":null,"work_id":"67b2eefd-a1d7-41c9-88d7-13e588752627","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.581017Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:134f6a551cca7737dd22aae37c23b3133efde02c4de6db1be3afbb1ecdfeb93c","observation_id":"5b09afa9-9cd9-4903-9a5a-e813cffb0543","resolution":{"observed_at":"2026-08-05T14:20:29.998179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10701","last_updated":"2024-07-15T13:17:42Z","snapshot_observed_at":"2026-07-06T18:46:26.900364Z","submitted_at":"2024-07-15T13:17:42Z","title":"DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10701","snapshot_observed_at":"2026-08-05T14:20:24.762308Z","title":"Docbench: A benchmark for evaluating llm-based document reading systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.762308Z"},"links":{"cited_paper":"/paper/2407.10701","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:f3088c78e320c1a713911582d5454370dc6231017e168b76372f37a6887d2ba2","observation_id":"a7068012-6c16-455a-ba9a-a227db41d7bb","resolution":{"observed_at":"2026-08-05T14:20:24.762308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T14:20:24.883307Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.883307Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:deb0dc4377cbb1a049938236473807826f1dd9a5660969782d4c7b95479cf407","observation_id":"463c174f-422f-4bf7-8a24-ff1346cb8e08","resolution":{"observed_at":"2026-08-05T14:20:24.883307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-08-05T14:20:24.672980Z","title":"Available: https://arxiv.org/abs/2411.06176","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.672980Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:0a36eb798f066732c46d3edefe5dde7efa572c6ab6bae11c31c0fdc1d3924951","observation_id":"63cf2eeb-754b-40e3-829e-c38033740bdd","resolution":{"observed_at":"2026-08-05T14:20:24.672980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11576","last_updated":"2025-03-14T16:44:14Z","snapshot_observed_at":"2026-08-07T17:03:24.339033Z","submitted_at":"2025-03-14T16:44:14Z","title":"SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11576","snapshot_observed_at":"2026-08-05T14:20:25.170342Z","title":"Smoldocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.170342Z"},"links":{"cited_paper":"/paper/2503.11576","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:6bf53f1f6935ec90a76e80b87edbb968baadea505908506f18d3bb9dd5789e70","observation_id":"0b8afe44-8a1a-46f0-bb21-6192ce1ac89a","resolution":{"observed_at":"2026-08-05T14:20:25.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.626744Z","title":"Pdf data extraction benchmark 2025: Comparing docling, unstructured, and llamaparse for document processing pipelines,","venue":null,"work_id":"15efcdaa-bbd9-41a9-b4b9-71d67dc21fcd","year":2025},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.310390Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:e6c26d69ba996888ef75f404cde951c7da21d734532588ccfe50c36ef6caf357","observation_id":"63da7747-6544-42c2-b6f3-28763bbb382e","resolution":{"observed_at":"2026-08-05T14:20:29.714799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09869","last_updated":"2024-12-09T09:20:54Z","snapshot_observed_at":"2026-08-09T17:57:14.160185Z","submitted_at":"2024-08-19T10:20:06Z","title":"Docling Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09869","snapshot_observed_at":"2026-08-05T14:20:25.043109Z","title":"Docling technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.043109Z"},"links":{"cited_paper":"/paper/2408.09869","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:a53ee72b0e49470e977fe189f1055e334d54e8a22354bb6e4955d2955571a03a","observation_id":"d89c6c31-da03-41d0-9765-b874d46061af","resolution":{"observed_at":"2026-08-05T14:20:25.043109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.421433Z","title":"Icdar 2019 robust reading challenge on scanned receipts ocr and information extraction,","venue":null,"work_id":"5681aefd-543a-4065-84dc-edacd46c1f12","year":2019},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.574862Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:7dd91829185887a03972b343221d78b7b40836d6e9d0754eecb5e3eb1257a517","observation_id":"28516716-8c73-4d53-8e84-be9d4e3feef8","resolution":{"observed_at":"2026-08-05T14:20:29.494652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:29.181597Z","title":"Field extraction from forms with unlabeled data,","venue":null,"work_id":"908427cf-fed8-4fcb-8960-9bc03e2b322f","year":2022},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.713563Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:cecb8c5822e3686298ba6ef81f15466c83369f67bdccfbe834a98206838db489","observation_id":"d495aad1-eb43-4047-83c5-ac40093a04a4","resolution":{"observed_at":"2026-08-05T14:20:29.253485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:25.424347Z","title":"Ocr-free document understanding transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.424347Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:23f459da3cecc119f7e35e8bdb55ce2926f0f95ed7b60301debabe054778e420","observation_id":"420f57b5-134c-4055-91b6-f8da0a8e243e","resolution":{"observed_at":"2026-08-05T14:20:25.424347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:27.012195Z","title":"Layoutlm: Pre-training of text and layout for document image understanding,","venue":null,"work_id":"ddf6c1dc-e0a1-4855-a53d-095c1ab32091","year":2020},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.924804Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:24646ca0b1da29e87e246f7c148687c325a12bca9da5f7ac2fb2bf99ba78f6bf","observation_id":"8f899c6e-b581-4a55-bb0e-b5dc7e5d3b86","resolution":{"observed_at":"2026-08-05T14:20:27.117317Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:26.608241Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking,","venue":null,"work_id":"abedb03f-d03d-4e2a-a1d4-e6e50943fb70","year":2022},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:26.035589Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:4f29b26eb8d066d822f73eb3eaf781ee5ba6f5ccb27e32075c07f915fbd1084c","observation_id":"cd29b14b-566c-4a13-8616-c2885530940f","resolution":{"observed_at":"2026-08-05T14:20:26.734768Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:28.964750Z","title":"Truth tobacco industry documents (formerly legacy tobacco documents library),","venue":null,"work_id":"1f24eea2-4a71-4dca-ada5-f5e0d1a6b40d","year":2002},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:25.840205Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:066fb1fe5b0edf93fe702558c036a7800e26709ed7c5194e8af0dd72fdb86999","observation_id":"8f6fbf9d-d63a-42fb-8116-d30b7f2a2fe9","resolution":{"observed_at":"2026-08-05T14:20:29.089939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:28.786747Z","title":"Lilt: A simple yet effective language- independent layout transformer for structured document understanding,","venue":null,"work_id":"101a384f-cab1-47f9-9d58-ceed6341c632","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:26.134753Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:143cb9450a9bcf54839fc2c7391ee16c4e5f85189d7fed43401e775edff95330","observation_id":"1453c3ad-843d-464a-9243-9ea03ac71c51","resolution":{"observed_at":"2026-08-05T14:20:28.848561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:27.880244Z","title":"Available: https://doi.org/10.1145/3342558.3345421","venue":null,"work_id":"be88691c-961b-4945-8313-974b76018926","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:23.281575Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:a817b8f8a19219ca208fbdf7c379a1b1b7a0524e88ef6a56b8a63bfcaae38d16","observation_id":"4c7db77f-c7e1-43c0-9a40-0aa40ab351d7","resolution":{"observed_at":"2026-08-05T14:20:28.028635Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:20:28.507158Z","title":null,"venue":null,"work_id":"c89c6427-6747-4cd2-9edd-0de115c6e810","year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:26.273267Z"},"links":{"citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:ce4e414072a46875f62e4187031dd8789a28c910c323562de3f5e5a828f04499","observation_id":"9fb6ba9c-b98d-43be-a961-0e4f1390640f","resolution":{"observed_at":"2026-08-05T14:20:28.634779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13264","last_updated":"2024-10-11T00:06:31Z","snapshot_observed_at":"2026-07-06T18:33:28.511600Z","submitted_at":"2024-06-19T06:50:15Z","title":"WONDERBREAD: A Benchmark for Evaluating Multimodal Foundation Models on Business Process Management Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13264","snapshot_observed_at":"2026-08-05T14:20:24.320091Z","title":"Available: https://arxiv.org/abs/2406.13264","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:24.320091Z"},"links":{"cited_paper":"/paper/2406.13264","citing_paper":"/paper/2509.04469"},"observation_digest":"sha256:b2b49fda1d59b3f91bb7f5f36f2a9b5bc2584416e945b51b2a9a8859a55abbd2","observation_id":"21ee41fd-fcae-48f7-a742-f5ac024f7e33","resolution":{"observed_at":"2026-08-05T14:20:24.320091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04469","last_updated":"2025-08-29T09:09:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:09:24.814923Z","submitted_at":"2025-08-29T09:09:20Z","title":"Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2509.04469."}