{"as_of":"2026-08-10T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:272ec426a3f0c49625bbec0b021fe3f8c927ec866578efb783a1963edec50de9","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:28:58.667157Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:43:50.289411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:44:22.118843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-08-03T10:43:50.289411Z","title":"Bench- marking vision-language models on chinese ancient documents: From ocr to knowledge reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-08T18:45:43.759614Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.289411Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:3df8d2d3810afe60e013aad41141f33d9bea78843d51ce449491b0d463482409","observation_id":"c9610636-bfdd-465c-899e-ffaf66302045","resolution":{"observed_at":"2026-08-03T10:43:50.289411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-08-03T10:43:42.247993Z","title":"Benchmarking vision-language models on chinese ancient documents: From ocr to knowledge reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-10T07:54:29.987163Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.247993Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:82cf8d0c3a7fdb33b5c5c01356d83a74bee6dc60d73ceb203d1886feaa67c32e","observation_id":"21d2f413-1c2c-4719-80dc-18887a1dfc29","resolution":{"observed_at":"2026-08-03T10:43:42.247993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2603.18472","last_updated":"2026-04-09T02:35:56Z","snapshot_observed_at":"2026-07-06T22:49:37.944352Z","submitted_at":"2026-03-19T04:08:20Z","title":"Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T09:11:31.870441Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2603.18472"},"observation_digest":"sha256:bb3610b5e6ca34cb2ddc886fb2b7954e312c15491d19a99bee0faab7a037323b","observation_id":"ef8ec59e-2475-4d72-9873-5ec42160fd27","resolution":{"observed_at":"2026-05-15T09:15:21.120295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2604.03339","last_updated":"2026-04-03T07:59:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T07:59:26Z","title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T20:01:57.029143Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2604.03339"},"observation_digest":"sha256:273373a9f25a61aecba0f5c9999c26bfc5532d2c6b8170003a71b3700cad399b","observation_id":"cbb588df-907a-4b40-b2b3-94f4a0190531","resolution":{"observed_at":"2026-05-13T20:03:12.218516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2605.18173","last_updated":"2026-05-18T10:15:57Z","snapshot_observed_at":"2026-08-02T16:11:51.976692Z","submitted_at":"2026-05-18T10:15:57Z","title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T11:28:51.711892Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2605.18173"},"observation_digest":"sha256:5f1b9e5ce10b8c1e2ed7f2fd1a4db4f587b2165e0c33ea2694bdc30d8120147f","observation_id":"2e45042a-e34d-459a-a9c2-1c5fa0724e2a","resolution":{"observed_at":"2026-05-20T11:33:14.587866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2606.29378","last_updated":"2026-06-28T13:01:54Z","snapshot_observed_at":"2026-08-06T08:18:12.503891Z","submitted_at":"2026-06-28T13:01:54Z","title":"Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T07:37:05.806389Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2606.29378"},"observation_digest":"sha256:fda4b37b089f2dfc04e5f4ba2f8c047f31825eecdbfcbef391b619dc516594ad","observation_id":"9712d40b-4612-4798-8402-1b1288ccb31d","resolution":{"observed_at":"2026-06-30T07:44:22.120541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-07-11T21:21:23.781984Z","title":"arXiv preprint arXiv:2509.09731 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04147","last_updated":"2026-07-05T07:15:17Z","snapshot_observed_at":"2026-08-09T03:20:52.573749Z","submitted_at":"2026-07-05T07:15:17Z","title":"HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T21:21:23.781984Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2607.04147"},"observation_digest":"sha256:e81abd0350fc1861a72e5cb8361c40cade56a6136e5cbf5267a3fe7ea631ea8b","observation_id":"83074fb5-d41f-4cdf-9a24-a1817977b1fe","resolution":{"observed_at":"2026-07-11T21:21:23.781984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09731/citation-record","integrity":"/paper/2509.09731/integrity","json":"/paper/2509.09731/citation-record.json","paper":"/paper/2509.09731"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:55.488191Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.488191Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:ce2e0082d728e66f275f0e045b73c9b13a4b791c96b9ca63a49439a62bae6ff9","observation_id":"f05893e5-57e7-48f1-94d7-59d5ba16ed80","resolution":{"observed_at":"2026-08-04T20:28:55.488191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:55.595187Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.595187Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:60a03c5cbab0108e7298555673ac76969432fa0fc7be11ee7593b2ea315dbd9f","observation_id":"9c830c9c-e00f-480a-aa2f-9052dcf7e671","resolution":{"observed_at":"2026-08-04T20:28:55.595187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:55.684666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.684666Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:9901f4e99fd04267ee9f14b8d58a9104d70d1e36ab3575ac2349cd45960956bd","observation_id":"911156ce-463a-4dba-bc3f-d66365587edb","resolution":{"observed_at":"2026-08-04T20:28:55.684666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T20:28:55.790100Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.790100Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:4b8163f631d66dcf6069bc93909e3af4204e116dd0ad0cb7c4b7ef4c96e8f5bc","observation_id":"2e3ce02e-f44c-4212-b5a4-927873b0f9a2","resolution":{"observed_at":"2026-08-04T20:28:55.790100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T20:28:55.948935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.948935Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:c4aa23f0e7cdec7ab79c0be6897d91720e03a1479f59a60c2bd826e5e80a6df6","observation_id":"e85b5855-540f-4cbd-ad86-e59174dcc118","resolution":{"observed_at":"2026-08-04T20:28:55.948935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.073670Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.073670Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:f29c14444d438b548cd594de6b82e21f8357c1870b6a74497189c321c25ad775","observation_id":"6834c168-d5bc-4d4f-bfcf-8ac73ba9974d","resolution":{"observed_at":"2026-08-04T20:28:56.073670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T20:28:56.209162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.209162Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:e70f6210b4a2b3af08d57373adef29be12adb7fed01e7bf845032cb5e4e91cfa","observation_id":"ecce6003-8a7a-455a-aa1b-4041f0ba2e20","resolution":{"observed_at":"2026-08-04T20:28:56.209162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T20:28:56.327267Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.327267Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:c943063ff9909d3d1be22e092a56ae445b9887e4ee58fd64e200d1d35666970e","observation_id":"7d5ee3e1-6496-4354-9378-596ae27ace96","resolution":{"observed_at":"2026-08-04T20:28:56.327267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.531953Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.531953Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:94053aa97b5835e6e80a5ed280de4496d7b3a5eb3c0a1ce1cf8c5ed85f6fe05e","observation_id":"ce9c5351-e408-496c-9530-fecc5e903803","resolution":{"observed_at":"2026-08-04T20:28:56.531953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.669105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.669105Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:315d4fa4b6d967175f190d9deb341f7b1803f570fb0d00d65944b1c529cdb933","observation_id":"68bcb4c3-60dc-4df5-8581-fb6c5d484b7d","resolution":{"observed_at":"2026-08-04T20:28:56.669105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12720","last_updated":"2024-04-19T09:00:05Z","snapshot_observed_at":"2026-07-06T18:02:36.759308Z","submitted_at":"2024-04-19T09:00:05Z","title":"PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12720","snapshot_observed_at":"2026-08-04T20:28:56.764648Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.764648Z"},"links":{"cited_paper":"/paper/2404.12720","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:098b92de29327d4dcce3269c7d34e5543abe3a1ed06dffe1d2baaa5d0ea7ea3e","observation_id":"0f233e32-b037-4401-a55e-61e8655d5b7d","resolution":{"observed_at":"2026-08-04T20:28:56.764648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-04T20:28:56.875999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.875999Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:c0bab0d2b8006068872416ab5fcbde5f328aefa40ac2dd4eaf0e023ba1288fe1","observation_id":"84b965d6-31f2-41d0-8c12-0fd77429e975","resolution":{"observed_at":"2026-08-04T20:28:56.875999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.997145Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.997145Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:5ef668a48eb6a8b6111d2376a10a64cd3be9323f7827eb615e7e2538c870bb01","observation_id":"ba7ee8dd-4604-4a9c-98d6-3baa29446f36","resolution":{"observed_at":"2026-08-04T20:28:56.997145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.072509Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.072509Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:ca578d162743f416433c0f86ae10c4532b65c32b8c76c31b9d07fa7710b68a2f","observation_id":"dc4c2ace-bcc7-4d7e-bfab-26327dd3bb54","resolution":{"observed_at":"2026-08-04T20:28:57.072509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T20:28:57.160446Z","title":"P.; Perelman, A.; Ramesh, A.; Clark, A.; Ostrow, A.; Welihinda, A.; Hayes, A.; Radford, A.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.160446Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:aafb96e23deb4dcf8665adeee775b19d13a8c4845bbc0b57715e015fb2ee2fba","observation_id":"42173e17-e42e-42e5-b848-cb63742da6a0","resolution":{"observed_at":"2026-08-04T20:28:57.160446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.312037Z","title":"R.; Fujii, Y.; Deselaers, T.; Baccash, J.; and Popat, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.312037Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:4be8aad2451fe23d54a475cc89a20abd07d0eb80c446f50c22f0d0affcef7ac5","observation_id":"b5f7687b-1782-48cb-9d62-ba4b4368a11a","resolution":{"observed_at":"2026-08-04T20:28:57.312037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.424293Z","title":"K.; and Thiran, J.-P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.424293Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:5f85c6973570172d9bd2823f06a89c98a9e809a5a047907387959ad028625d43","observation_id":"d8a52f64-a8c7-4f46-957b-134fb5139a23","resolution":{"observed_at":"2026-08-04T20:28:57.424293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.529652Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.529652Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:6cec38eb938e9f04473b1c3ec446ad652393eca217584f99685b9ab8460633fd","observation_id":"557e4200-db46-4c2c-9ca7-ecdaffba2050","resolution":{"observed_at":"2026-08-04T20:28:57.529652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.596554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.596554Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:f3c4b0f1f45eecd6bb57cda3dd40f849a716b03ef351c1921dbc4ac4830519c5","observation_id":"e9721f0c-8083-44ed-9efa-6785e0f783e6","resolution":{"observed_at":"2026-08-04T20:28:57.596554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:28:57.652002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.652002Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:f953f04fea9e054e7275cc55ede01b4ceef1b290d798d4dfc09341c9e4fc2557","observation_id":"2dea98c2-cd7f-40d1-a31d-8ab4466ca338","resolution":{"observed_at":"2026-08-04T20:28:57.652002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.683646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.683646Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:25b793c6a019825e9d46b9296905a006a09bbb10604119b8ecad08a94e1a93df","observation_id":"e238eea3-6f32-4f64-bf99-eb5048bc4d12","resolution":{"observed_at":"2026-08-04T20:28:57.683646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.710848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.710848Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:e35cdd7ff979cfc430da043d8c47c77ad46252bbcdf60d4e496c61574b1ab5c9","observation_id":"afc78959-9777-4895-b889-565758f6bf31","resolution":{"observed_at":"2026-08-04T20:28:57.710848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.813522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.813522Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:87caf5d48fa4f6630c1c2ae8abd85df3d3fea822a67bac9920fae0f39fadda7e","observation_id":"6313de6a-6945-4398-91eb-2c5e59d25685","resolution":{"observed_at":"2026-08-04T20:28:57.813522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.959749Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.959749Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:28c06747b8e364832d40c147764230f24174839fd37f394a745ebeb790f2559b","observation_id":"444421fb-3811-4a36-9131-5a4d9e8f1d4d","resolution":{"observed_at":"2026-08-04T20:28:57.959749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.058222Z","title":"K.; and Chakraborty, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.058222Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:23601f0ba5ff50bcdb9c0e2e336baf9c43cf6e33199a2e425b519c1491c9af72","observation_id":"923980f4-301f-4b64-a468-19ced63e1a27","resolution":{"observed_at":"2026-08-04T20:28:58.058222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.157387Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.157387Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:000e49921140fd934060f4d0a81ba9c4892e5c72c857e98e2e6bb43b1d42ddb1","observation_id":"b4a61e2b-1906-41e8-bd58-0084f410b66e","resolution":{"observed_at":"2026-08-04T20:28:58.157387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T20:28:58.325357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.325357Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:9e2d246147221fa1b53d2c20cd8ad96ed8a8373abd5ca35a54e14cf793f788db","observation_id":"5c05b445-3443-469b-9358-f8e16c6f8c64","resolution":{"observed_at":"2026-08-04T20:28:58.325357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.539509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.539509Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:978ca0effde449dc9d7c9517fe869c3d9c580e0e4619723b942434b86db6c66b","observation_id":"0f80da44-369f-4492-8a0a-4290147fa0e3","resolution":{"observed_at":"2026-08-04T20:28:58.539509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-04T20:28:58.597765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.597765Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:d56628668f7c2e32b9599a4ca4ce43b86ab0d599785ba0702deb1d0960484d52","observation_id":"9ae68a05-9103-4eaf-8053-81e0dc4ad9bc","resolution":{"observed_at":"2026-08-04T20:28:58.597765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.618224Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.618224Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:54c4bc62fb28516967d4c664866a69aa8ac3d244d6f9d556bc7d58ea0742ae82","observation_id":"91e7c22a-d528-4915-896f-12537a872ee0","resolution":{"observed_at":"2026-08-04T20:28:58.618224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02210","last_updated":"2023-10-24T14:00:21Z","snapshot_observed_at":"2026-07-06T15:12:22.395669Z","submitted_at":"2023-04-05T03:49:06Z","title":"Document-Level Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02210","snapshot_observed_at":"2026-08-04T20:28:58.622466Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.622466Z"},"links":{"cited_paper":"/paper/2304.02210","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:4da825249121d3c2bb20d706350bd0e81cbb958ac7faca498c26a16f0c7356f7","observation_id":"2f82990a-7b0e-4f6f-9248-e855639de8e4","resolution":{"observed_at":"2026-08-04T20:28:58.622466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-04T20:28:58.627438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.627438Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:8646757659e60a9e7a9ee1d66693bb25563c73b4ba801f2e5cdfcbff7c3ab0aa","observation_id":"b0370a9e-7487-4a8c-95a0-23490b382d37","resolution":{"observed_at":"2026-08-04T20:28:58.627438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T20:28:58.632055Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.632055Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:3ad9ae128d3e8473db62a6bf4c4f5d035f51c7f3d5a0019a2aa34e313cb73bff","observation_id":"dc243383-6c26-4150-adad-655e754655e4","resolution":{"observed_at":"2026-08-04T20:28:58.632055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.636639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.636639Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:4eb7679ef5b5e29662b3101f9d958b93431b085cabcc17386995fc226646c129","observation_id":"39b8b67e-0687-4bd8-bcbb-e42f47b4ee30","resolution":{"observed_at":"2026-08-04T20:28:58.636639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.640806Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.640806Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:99352ee3cde1e8e49821fed7619901884064fbddf9e64b089607bdcbf7a04526","observation_id":"feb55710-8259-4352-a362-ac138cbf8833","resolution":{"observed_at":"2026-08-04T20:28:58.640806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.01727","last_updated":"2017-09-06T09:01:53Z","snapshot_observed_at":"2026-07-06T05:58:19.597227Z","submitted_at":"2017-09-06T09:01:53Z","title":"Scene Text Recognition with Sliding Convolutional Character Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.01727","snapshot_observed_at":"2026-08-04T20:28:58.645516Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.645516Z"},"links":{"cited_paper":"/paper/1709.01727","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:e0636a5899a83abb7d1f4a4d95d6e344ef25bd0d5d26a9e6d8272419c0f2bf95","observation_id":"ec2d7cb7-7569-40e7-8bc1-a9848774673e","resolution":{"observed_at":"2026-08-04T20:28:58.645516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.03581","last_updated":"2018-10-08T17:09:10Z","snapshot_observed_at":"2026-08-09T12:09:40.487307Z","submitted_at":"2018-10-08T17:09:10Z","title":"Improving the Transformer Translation Model with Document-Level Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.03581","snapshot_observed_at":"2026-08-04T20:28:58.650005Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.650005Z"},"links":{"cited_paper":"/paper/1810.03581","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:799ab8abc5f066d354441829a2aec244de26ddef7ebb59993149cf892d2ae7e3","observation_id":"66b223fc-2b55-4828-9264-a360d38b7796","resolution":{"observed_at":"2026-08-04T20:28:58.650005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.654420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.654420Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:ac44147b04df9d148238d24c258264f6d15075978392420322cfa216581fc572","observation_id":"57cf7a75-b14d-410c-b564-3b60a47697cc","resolution":{"observed_at":"2026-08-04T20:28:58.654420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-04T20:28:58.658554Z","title":"Q.; and Artzi, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.658554Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:3c54c4f92a0d21b13982ba1b3d4670d69471d8892d24b8962040ca1de21e339c","observation_id":"d9796f94-fb58-4486-ac5f-04c0ca76b3ba","resolution":{"observed_at":"2026-08-04T20:28:58.658554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.663051Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.663051Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:cc8d832d4e86fa3eb0d6be52c2f51c60259d50368b4f03d05a96819516f642ee","observation_id":"2ba5b515-1068-40d9-bb03-eff27398cdb4","resolution":{"observed_at":"2026-08-04T20:28:58.663051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T20:28:58.667157Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.667157Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:4681dbf77183e98e191944ebca89aac420c2daa4eef339aed12b4d293ce14e53","observation_id":"c59d43ff-edc1-49a5-93b1-705d9c032d02","resolution":{"observed_at":"2026-08-04T20:28:58.667157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T07:41:45.267634Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2509.09731."}