{"as_of":"2026-08-14T22:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a88a32a3e760808d1a0c70b99956cb9f4e758c277e13d4c6bb5637af4fde5dcb","coverage":[{"denominator":199,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:43:52.590870Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10628/citation-record","integrity":"/paper/2608.10628/integrity","json":"/paper/2608.10628/citation-record.json","paper":"/paper/2608.10628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.432498Z","title":"arXiv preprint arXiv:2512.12658 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.432498Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4c7671fb0c928df89ce2d99a50337eeef5c6368f2bd01cc22157e89a05fc8ea3","observation_id":"252d44f8-cc45-4048-927b-630f39a59135","resolution":{"observed_at":"2026-08-12T20:43:51.432498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.446345Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.446345Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:33b1bd2d2f77df6f0b0531d70ed5ee7a990f2c884028ec66f43dab5d72ce1d34","observation_id":"dec4f006-069d-4719-a589-2ec7b1e472fd","resolution":{"observed_at":"2026-08-12T20:43:51.446345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18600","snapshot_observed_at":"2026-08-12T20:43:51.464398Z","title":"arXiv:2602.18600 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.464398Z"},"links":{"cited_paper":"/paper/2602.18600","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:2ca6539d7f3ebb452e089e367c895dd17551233f3590931ce8e44b4fc2de5ea8","observation_id":"b7641b32-c2c3-4da9-b257-69e33e6c7157","resolution":{"observed_at":"2026-08-12T20:43:51.464398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.477897Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.477897Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:71b04ad302c1305ed79a53526870e97c7a18a55b9035103cb40d86b8487e8278","observation_id":"40e2bddf-1586-4fc6-a2a4-7991bdd27c05","resolution":{"observed_at":"2026-08-12T20:43:51.477897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.488481Z","title":"arXiv preprint arXiv:2603.13398 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.488481Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:0dffc7dd6e8e09b00c252b6f2d4ce86139d81faf3f75408b772366d7c6719d01","observation_id":"1001e82e-65c3-4a1c-85a2-598cf0a73054","resolution":{"observed_at":"2026-08-12T20:43:51.488481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.498526Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.498526Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:c8671eb6afbf81dd74c7dd9cddc380e037edb7898ce8d7a9cf81a7e9705ec9ea","observation_id":"09b71924-4262-4f5f-a020-683a58dbc5c1","resolution":{"observed_at":"2026-08-12T20:43:51.498526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13731","last_updated":"2026-04-15T11:12:27Z","snapshot_observed_at":"2026-08-03T00:33:20.640303Z","submitted_at":"2026-04-15T11:12:27Z","title":"Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13731","snapshot_observed_at":"2026-08-12T20:43:51.507506Z","title":"arXiv preprint arXiv:2604.13731 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.507506Z"},"links":{"cited_paper":"/paper/2604.13731","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b8892ab44c2469c014edb6faabc97a605becef0b9025e9e6d9552e44bce966d3","observation_id":"5afb696d-64b0-4563-933b-4482853453ea","resolution":{"observed_at":"2026-08-12T20:43:51.507506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.518345Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.518345Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:39c1780b8b6e12d8aa76ce7b87708831cfd92d8dd35f981254293bae50c28e37","observation_id":"cb0215e6-1f3b-450d-9188-13a785ae3ac2","resolution":{"observed_at":"2026-08-12T20:43:51.518345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.523976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.523976Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5dbcb16ad3467987dc3330a534d64ead63f5b5152779e909bd46615ad70c2534","observation_id":"e7719801-fd04-457f-b89a-919909a4fcc7","resolution":{"observed_at":"2026-08-12T20:43:51.523976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.539894Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.539894Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f1eed0e2f543f883812c58a1faeec93c5fcc7d1905e990dcd14c4324a4b756b5","observation_id":"e63e6ad7-e67f-4abc-b201-f9c4b83c70ec","resolution":{"observed_at":"2026-08-12T20:43:51.539894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.546249Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.546249Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8682fd9bcdf10c9a756b8898bb9657fac6bfeeaf3c3e12dc5cdc85ab05d7797a","observation_id":"672bba5f-01c6-4b54-a51e-d167ed7d44f2","resolution":{"observed_at":"2026-08-12T20:43:51.546249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.553717Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.553717Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:fbb9ca5f4e57c45de90763bef5efde888d92b2b9962edb4b7a2160689072c3ac","observation_id":"a38ddcfc-f673-4304-a806-f709a0117ce3","resolution":{"observed_at":"2026-08-12T20:43:51.553717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.565070Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.565070Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:41a13987be82153e454a912d3103efbfdfbadf971fd1f81074d60e7b9f42cf89","observation_id":"a831a54f-1b74-4fae-88c8-617e82d96a2e","resolution":{"observed_at":"2026-08-12T20:43:51.565070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08899","last_updated":"2021-07-18T03:09:51Z","snapshot_observed_at":"2026-08-10T20:40:29.904837Z","submitted_at":"2020-08-20T11:36:36Z","title":"Document Visual Question Answering Challenge 2020","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08899","snapshot_observed_at":"2026-08-12T20:43:51.584010Z","title":"arXiv:2008.08899 , year =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.584010Z"},"links":{"cited_paper":"/paper/2008.08899","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3b13ce644b41203de296059b3200cb385c2790ccc117e69e2730d25226fb774b","observation_id":"81b7bd03-0d3a-44b1-a0fd-b37ec41857ca","resolution":{"observed_at":"2026-08-12T20:43:51.584010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.597646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.597646Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5ca1c8230d963af06d44b56fd56177f35380843eb6ba580d9aa684ce1df553ac","observation_id":"332f52bf-d3cd-4076-85d7-c6109aacbca8","resolution":{"observed_at":"2026-08-12T20:43:51.597646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.606190Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.606190Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:26acdd71e04f4538647918a86c99af51079ab4b6bd43f0ebc9450ed01724c0f8","observation_id":"f16fa77a-e750-44b9-8802-c2b5ba3dd8fd","resolution":{"observed_at":"2026-08-12T20:43:51.606190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.616664Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.616664Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:dc02f5484fbe5d0bd2a5782bad7f53e2affbc89e5ae98b93c398eee06c4e6d3b","observation_id":"b3b492af-117b-4e90-b799-1ced3d47409d","resolution":{"observed_at":"2026-08-12T20:43:51.616664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.629863Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.629863Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3892747a63dd97e377ce11d5f352a88e76856dbfc585773bd170158401480df9","observation_id":"d3571ea2-8f80-46b3-9e43-e047a5a69e46","resolution":{"observed_at":"2026-08-12T20:43:51.629863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T20:43:51.639847Z","title":"arXiv:2308.12966 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.639847Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:03f14fca00eb99a7d2105e3fd021c1ad8d1b94d9b769311fd552d47806b24b35","observation_id":"fa56d2c8-0df5-41d6-b51b-00c56501f712","resolution":{"observed_at":"2026-08-12T20:43:51.639847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-12T20:43:51.656744Z","title":"arXiv preprint arXiv:2510.18234 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.656744Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:1eadd320b3115dc3a99e09cfb26040b793266244838fa9c520075b1728b3e814","observation_id":"a451611d-030d-4062-bc27-f7ccdd8779b6","resolution":{"observed_at":"2026-08-12T20:43:51.656744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T20:43:51.667703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.667703Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f9afb3ef0df53c5be049c22d0f6500d9da1dd1f1c67762525c55196fd66c2276","observation_id":"9f58c408-ce50-4d3e-9fd7-9a1c70304ea6","resolution":{"observed_at":"2026-08-12T20:43:51.667703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T20:43:51.676451Z","title":"arXiv:2304.14178 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.676451Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a8ae45bd9452426c4467d4ffddcf68f83f191f71f0654fac2ce86ca221500156","observation_id":"147fec38-9698-454a-a3db-8271b2b8dd02","resolution":{"observed_at":"2026-08-12T20:43:51.676451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.690654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.690654Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:41e69e3d93dc9e317f935bedf0e77ac234b28fbc707670189a7cfb5f278fd9b9","observation_id":"fbf0df0f-6371-4f85-9f84-c2b6e64175cc","resolution":{"observed_at":"2026-08-12T20:43:51.690654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.697229Z","title":"2024 , publisher=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.697229Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:049f21c490ef8618b671cc22c8126a478c458477fca904f6e5ae5d0acd7620ae","observation_id":"5b0a4b09-f328-4d6a-b547-3bd3ec1ab2f6","resolution":{"observed_at":"2026-08-12T20:43:51.697229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T20:43:51.711511Z","title":"arXiv:2410.21276 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.711511Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b32106a91062c3712fecf10f98ff933daec70eca1715265b483a3ded186e4e6e","observation_id":"334a934c-fb23-4d50-a053-f89ac8a0607d","resolution":{"observed_at":"2026-08-12T20:43:51.711511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T20:43:51.722559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.722559Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:77492252cb1069325ef0e4c270b25342f436bb974a2e1dd611c5403faf7032cf","observation_id":"7fe50c9f-18cd-43e4-99f4-8e9d5ee695d0","resolution":{"observed_at":"2026-08-12T20:43:51.722559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-13T11:03:04.175844Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-12T20:43:51.739388Z","title":"arXiv:2307.02499 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.739388Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e1b7d80e303f111721a432ca6e88abbc9f360be2abb249ce4ec85826ca3d3dcb","observation_id":"f114d9c3-8704-4518-bafa-06da7d6b8d6d","resolution":{"observed_at":"2026-08-12T20:43:51.739388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-12T20:43:51.753530Z","title":"arXiv:2308.13418 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.753530Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:c798604bda0262a681dc54f3f895a324c6096ebda47bce17822a17656d51c251","observation_id":"3cff5cdb-d50d-4abb-995b-38bbf7c5ed97","resolution":{"observed_at":"2026-08-12T20:43:51.753530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.776117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.776117Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8f47b59763279a9b448dea76ede3a1ce65d35555808aea2d36ab71183572d728","observation_id":"58b14e08-50f2-4e7f-a2f1-19610f38c248","resolution":{"observed_at":"2026-08-12T20:43:51.776117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.796757Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.796757Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:816e28e70baa6ce5f63146cdd22a752c1d52d5c3b89acbfa75cf0767343f957a","observation_id":"d4cde66d-d70b-4884-ae35-91b6b5cea85b","resolution":{"observed_at":"2026-08-12T20:43:51.796757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-08-13T06:43:11.823135Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-12T20:43:51.809462Z","title":"arXiv:2407.01449 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.809462Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:d98c2e408bd5c420edb7312bd1df51ee538c5074d22bda011e314fa37ff753ca","observation_id":"2b366537-f7b1-421b-81b6-29c6e3e6f161","resolution":{"observed_at":"2026-08-12T20:43:51.809462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.821654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.821654Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b7aa8f573fb851e9f09ef15d4ec7da14af43d0bd5cf469baffb6f05ad860e5a0","observation_id":"50f2f655-2141-412a-b968-ec108dc394a7","resolution":{"observed_at":"2026-08-12T20:43:51.821654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.831411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.831411Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:9f5d42ed2cf57f676a77cec53a8b2b6429a991bb69d2c715072ccde09702c033","observation_id":"8baf5c4c-7a9e-4886-b2cd-ae7d676bcfb7","resolution":{"observed_at":"2026-08-12T20:43:51.831411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.839257Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.839257Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:bbe08d2c23fd40d80a4661ad93de927ba88c64eeeee79139e00349445e6d91fd","observation_id":"594ed217-933b-4fe3-931b-aedc6ca9b0d6","resolution":{"observed_at":"2026-08-12T20:43:51.839257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-12T20:43:51.848796Z","title":"arXiv:2203.11171 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.848796Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4a7bce8400b9b23a59aac67647f398be53c39b7dca0b2c17ddc764d71493d948","observation_id":"e87d9acf-24ac-4f78-9db5-69792c0f9dbe","resolution":{"observed_at":"2026-08-12T20:43:51.848796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.861161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.861161Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a1b144f0eb17560688e810ee0e2f3542398ab92135f46b48196019ff9e3280d7","observation_id":"8c3d5310-718a-4e53-b295-159eb60c6cfe","resolution":{"observed_at":"2026-08-12T20:43:51.861161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.868376Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.868376Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:407a6e80e8af689c5af2dd60e882e9cec9a038541d22160726aca11d1855b17f","observation_id":"68ed8346-7caf-4114-b675-56c6fb8164dd","resolution":{"observed_at":"2026-08-12T20:43:51.868376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-13T05:57:08.016883Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-12T20:43:51.877474Z","title":"arXiv:2403.04473 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.877474Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:ff77cc3d9ccb43c850ae08b57a9bce7c56819355d0d212f241fd8adad01b0742","observation_id":"08328c3e-f410-4cbe-9e04-72f54d365aa2","resolution":{"observed_at":"2026-08-12T20:43:51.877474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.892832Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.892832Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:56e68fa45e86cc337b245274ea85c8cec508502bfdff84a71d5cd7ed130a5f71","observation_id":"51f7d0b5-4b3e-41c0-b048-44cbcb258702","resolution":{"observed_at":"2026-08-12T20:43:51.892832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.901323Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.901323Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:00d5f8ea6b4a75e4953d975ad0babd7869b3deb0d42db30e89e05d378c183c18","observation_id":"51c39407-6a26-487b-a69a-25b61a98c5b3","resolution":{"observed_at":"2026-08-12T20:43:51.901323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.912951Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.912951Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:cd86ebdcdb61a14bf70a1b6b0608a0b84b39c4a82d110669f9d67463a2ada634","observation_id":"7ccc012b-9775-494b-aec4-299746d5280a","resolution":{"observed_at":"2026-08-12T20:43:51.912951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-12T20:43:51.923345Z","title":"arXiv:2004.05150 , year =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.923345Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4f493d232e91565f0693c023a9465fce79adf1d0f0c69b2ceaeb2078d6da4783","observation_id":"e8f07bd9-2f91-4841-95fa-751dee6217fb","resolution":{"observed_at":"2026-08-12T20:43:51.923345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.936290Z","title":"arXiv preprint arXiv:2511.15090 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.936290Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:895e6b6a1307b6efc1b79f479fde21a291160762aa54356ff65a67511e48a389","observation_id":"cb02520a-382b-4875-8dbe-e778b5d56851","resolution":{"observed_at":"2026-08-12T20:43:51.936290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.955421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.955421Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:fd65d879b020ba0ba1e7e01924957511162af5456325a1b7ce234f1f6e40f6db","observation_id":"4fe68348-2f7e-404c-8306-8e18f2d94b48","resolution":{"observed_at":"2026-08-12T20:43:51.955421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.964109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.964109Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:065ea8a860826073f0d148bdbffe2d3e1890759699a2c965d6939232e4bd374d","observation_id":"0ce288a3-10d3-4663-87c2-1240f5938950","resolution":{"observed_at":"2026-08-12T20:43:51.964109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.979699Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.979699Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:dbc77ee91416a79b28b3da9385ccd9b3cfeda2bfb7b05a27a64a3d5091febd6b","observation_id":"32823e72-996a-4325-b01c-7680d623dbea","resolution":{"observed_at":"2026-08-12T20:43:51.979699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.989774Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.989774Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f69179ad1daf86b31b36e40c40329777a38d8c7e80fc432008a45028ff010125","observation_id":"ca68ebc9-77f4-4d6c-8416-9538ddb84409","resolution":{"observed_at":"2026-08-12T20:43:51.989774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-08-14T13:12:33.536233Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-12T20:43:52.001229Z","title":"arXiv:2411.04952 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.001229Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e20c8c234865decc46ffb4cfc8b21f7cf57dce413bf4f58c18ad4c5cc14f884c","observation_id":"582e90d9-4098-4feb-9738-86e666dbe2ab","resolution":{"observed_at":"2026-08-12T20:43:52.001229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.014167Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.014167Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3d980feae759969bf8f8a859b51bea9baf895f5308662879dec696765f38ec0e","observation_id":"eddacfde-f445-4ce7-8af7-1e48de586922","resolution":{"observed_at":"2026-08-12T20:43:52.014167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.031137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.031137Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f56f076bb19dae439e2d9a09bbc02cceb2513f4a3c18af6ce903dda46903e2b5","observation_id":"4a3bb0df-9127-4bb7-a0f3-86ab5812433a","resolution":{"observed_at":"2026-08-12T20:43:52.031137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.040519Z","title":"arXiv:2508.07313 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.040519Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:243f60f9489227a5692f5ea7e9dea693dce4474be0889de2c7e7d24638ffb8d4","observation_id":"54b40d6d-f2cb-4faa-8c57-8d40aa6ff646","resolution":{"observed_at":"2026-08-12T20:43:52.040519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-12T20:43:52.052394Z","title":"arXiv:2205.10625 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.052394Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:23e39c3c389f88c86b87eea7522e55195c441d765a11a2aba56d4cd96506586b","observation_id":"295cb0ab-c0f3-48ef-a834-d3d15280c5b5","resolution":{"observed_at":"2026-08-12T20:43:52.052394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-13T17:45:25.269133Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-12T20:43:52.061952Z","title":"arXiv:2410.10594 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.061952Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:16d83da62f038f30ef26f998b6f8bbe80db6f9937f7829534c2fc34465e5ac17","observation_id":"7fec3e01-fcdd-4874-a892-5cb342055ac6","resolution":{"observed_at":"2026-08-12T20:43:52.061952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.073991Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.073991Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:87e17298a11bb836a4b0ca9d378a78e0fae9532d3b2654320a31da434c2482e5","observation_id":"54b853ac-8e24-43fa-a30b-4b6a17c2d2f1","resolution":{"observed_at":"2026-08-12T20:43:52.073991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.086032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.086032Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:de21ea2379f8c8181f5b5c6c1407f0cf87d89758aac3ba64c6e96d384d54de8a","observation_id":"fe8023e3-0a56-4057-bc1b-0e51eda3011e","resolution":{"observed_at":"2026-08-12T20:43:52.086032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11592","last_updated":"2023-09-02T04:28:42Z","snapshot_observed_at":"2026-08-13T10:31:47.306856Z","submitted_at":"2023-08-19T17:32:34Z","title":"UniDoc: A Universal Large Multimodal Model for Simultaneous Text Detection, Recognition, Spotting and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11592","snapshot_observed_at":"2026-08-12T20:43:52.096954Z","title":"arXiv:2308.11592 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.096954Z"},"links":{"cited_paper":"/paper/2308.11592","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:7388528a5ad14a710efaeb1547692caff285c857ff22896679fb4f8cd787763d","observation_id":"c9a4207f-0eb8-4053-9169-a355d190e88f","resolution":{"observed_at":"2026-08-12T20:43:52.096954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.111220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.111220Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:1acbdf4af6cbf95c0f19482a70c8a59374d1190a81c67d01ed91708280e6c8c0","observation_id":"4dbf4a9a-3a19-4d19-a24c-192d881e87f8","resolution":{"observed_at":"2026-08-12T20:43:52.111220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01106","last_updated":"2025-03-02T22:41:37Z","snapshot_observed_at":"2026-08-12T22:09:21.952575Z","submitted_at":"2024-11-02T02:09:01Z","title":"SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01106","snapshot_observed_at":"2026-08-12T20:43:52.118382Z","title":"arXiv:2411.01106 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.118382Z"},"links":{"cited_paper":"/paper/2411.01106","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:06fddbbcf77b4c324e8f9748e60780f905b4000e56d165efd11c63a328d47e50","observation_id":"0cc08193-108e-46a1-acfc-09c3f17b05a5","resolution":{"observed_at":"2026-08-12T20:43:52.118382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05970","last_updated":"2026-04-27T13:16:40Z","snapshot_observed_at":"2026-08-14T12:07:36.260067Z","submitted_at":"2024-10-08T12:17:42Z","title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05970","snapshot_observed_at":"2026-08-12T20:43:52.128685Z","title":"arXiv:2410.05970 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.128685Z"},"links":{"cited_paper":"/paper/2410.05970","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:13cd5930004513e0cdf4369980b929dd6d08c3abd4de3a450df40ede71d72cee","observation_id":"90a1a7a2-55d6-4ad7-852f-07c574e5fab6","resolution":{"observed_at":"2026-08-12T20:43:52.128685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.134624Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.134624Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:0f28aff7f32a33c259fb5ff3b3d48bc623c6949ee4162bca447173a0ecd5f34e","observation_id":"ceb2f185-f069-48cd-b013-eb4788071475","resolution":{"observed_at":"2026-08-12T20:43:52.134624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.156133Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.156133Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:6284b7b6be229b32b628ad46c3d8d15a246d4fc2e7cdc93641a9fc11a227b0ac","observation_id":"0cf1e0d4-ab58-48fb-ad01-d4ab983b3f6a","resolution":{"observed_at":"2026-08-12T20:43:52.156133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.166937Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.166937Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:31da5b5a13f51b85feb433f9839a47a0229070e36718196eac01c8caf90a49fc","observation_id":"5d549344-35eb-433c-9850-db0b4353fb6c","resolution":{"observed_at":"2026-08-12T20:43:52.166937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-08-14T02:54:31.558222Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-12T20:43:52.180075Z","title":"arXiv:2409.18839 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.180075Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4c9a9bfd8c14d463fba6d452f77d19db02453d957eb68c8ece2789d1199ce032","observation_id":"093434eb-c772-44b7-8e2b-5323a8173c7e","resolution":{"observed_at":"2026-08-12T20:43:52.180075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-14T18:47:58.220615Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14059","snapshot_observed_at":"2026-08-12T20:43:52.188447Z","title":"arXiv:2505.14059 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.188447Z"},"links":{"cited_paper":"/paper/2505.14059","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8ee288ed148d64e2fb91b616dd9e9bc540ddab3810f40da0e95211154f472987","observation_id":"4de26b28-e5d8-40fc-81dd-65e4981ba74b","resolution":{"observed_at":"2026-08-12T20:43:52.188447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.195971Z","title":"arXiv:2506.05218 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.195971Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:541323b0a0dfef6c07c516244ef3004d3273dabfd5a6fa6972e5c5c717c85f78","observation_id":"bda85456-e951-4c62-819c-57626a064edc","resolution":{"observed_at":"2026-08-12T20:43:52.195971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.202073Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.202073Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:bb71a379b64cf6a2d98e72bfde5fafdcb4384ceaad1d697a2fcf4928e4bf8f46","observation_id":"32f5821c-cfe0-4bfa-87c8-13cfe900ef64","resolution":{"observed_at":"2026-08-12T20:43:52.202073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.210849Z","title":"2008 , publisher=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.210849Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3bdfc37db617f09c528864440029f8bd9bebb00ab3c902d5679a8bfa020b37b2","observation_id":"9c17be92-6fe3-46e5-8489-96dd894cc27e","resolution":{"observed_at":"2026-08-12T20:43:52.210849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.224864Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.224864Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e5255494bd82b8881c98f5cb8a45eed5304f7e9002cabe0329f83f91ef8ca24f","observation_id":"05916129-0074-4d17-ae07-34863406c925","resolution":{"observed_at":"2026-08-12T20:43:52.224864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T20:43:52.237790Z","title":"arXiv:2010.11929 , year =","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.237790Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:599360f3c7acbcdead0988caa889a72f0db9a6795a4fbd46dc96ab4d74200147","observation_id":"1cd54eb8-bc7d-41f9-a4f7-d70c038669a2","resolution":{"observed_at":"2026-08-12T20:43:52.237790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-12T20:43:52.244477Z","title":"arXiv:2412.16720 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.244477Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4c4df11742da8c27ecada7e3f33cd083c6cb9508ba67abad6b1746fc9ac7e69a","observation_id":"11ef51b3-6657-4e7d-b802-babdfb7a9acc","resolution":{"observed_at":"2026-08-12T20:43:52.244477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.255513Z","title":"2022 , organization=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.255513Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:149066baa324c9d3b64fd7176cb712917f9d6941811e37dc7479bf810e062841","observation_id":"15a98bb2-c84b-483d-a27b-b708d2cfc9fe","resolution":{"observed_at":"2026-08-12T20:43:52.255513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.265822Z","title":"2023 , organization=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.265822Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:bc3bd5dff67e90bfe2479ea9930c34d2f821cab35340ff1fe1ed901268f21060","observation_id":"f7471e8f-8070-40c9-82c6-497abeb0f69b","resolution":{"observed_at":"2026-08-12T20:43:52.265822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-12T20:43:52.301005Z","title":"arXiv:2412.10302 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.301005Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b3d685c50b0086929a30fc7f093bfc83cd27ff12e51513e14745b07d13fcefde","observation_id":"b2dad576-da8d-4595-880a-e41758577613","resolution":{"observed_at":"2026-08-12T20:43:52.301005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T20:43:52.309759Z","title":"arXiv:2408.01800 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.309759Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:41f912258810fd7c52f7ed304211daa42dc4e83af0bd482fedf29f11c77093e6","observation_id":"d6f39cd2-40a8-43bd-8a7b-ee49e1bbfb20","resolution":{"observed_at":"2026-08-12T20:43:52.309759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.318718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.318718Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:aaedfde9dc3251412295df8e97ea8212c48869f50f6e8b778f4a8dd003446e41","observation_id":"5db16b8c-6131-4920-81f8-1fcf1801cfa1","resolution":{"observed_at":"2026-08-12T20:43:52.318718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.328222Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.328222Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:c2bcb0e7c66ff4ad78dde908b60f1607289f8f008f13283a9b3829cddb524edd","observation_id":"70e9d84f-58b3-4734-8ce6-ca55f527e757","resolution":{"observed_at":"2026-08-12T20:43:52.328222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.337837Z","title":"2007 , publisher=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.337837Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:76c14b649d9369eafad0b2818ddfbde86c74417af890b219aebd669315e2a5ff","observation_id":"098c5b73-b8f2-4df4-8250-94bca2db840e","resolution":{"observed_at":"2026-08-12T20:43:52.337837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.344851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.344851Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:dfbf623ca0dd61feba5cff1720fc89b9bba403a2a15b50aa864209aacb960002","observation_id":"b1a4314a-3a76-4378-bdef-1332253cd0a1","resolution":{"observed_at":"2026-08-12T20:43:52.344851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.354372Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.354372Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:37f8d498db2124af28804fafd8b032f3effe24c13e33c0abf8fb880a5897722b","observation_id":"e978d148-e2b9-4667-ad93-77dffdbe4146","resolution":{"observed_at":"2026-08-12T20:43:52.354372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.363451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.363451Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:cb88f3b5d29b2f73ccb08b0760cb6a80fd9ca4665efce6230be3c18eed40c25e","observation_id":"e4c9834c-d628-4945-bc99-3366f27411c8","resolution":{"observed_at":"2026-08-12T20:43:52.363451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-12T20:43:52.371554Z","title":"arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.371554Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:20cc2a8b6343a33d4a102bb39ae6666ebe3ed10e5ee4238a6a05d625dc87d77a","observation_id":"fa196da2-c32a-4ada-bfea-d4677803e426","resolution":{"observed_at":"2026-08-12T20:43:52.371554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T20:43:52.382452Z","title":"arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.382452Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:6a1dddfb6812bb88a121f546d42ee3c2cb8d79caa7888232a54bb1f87f56dfdc","observation_id":"a4dcf1c2-3a6c-404a-bc4e-a4bfc0235cb8","resolution":{"observed_at":"2026-08-12T20:43:52.382452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.393482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.393482Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:07f61e38be6282493f959ea703a89ceeaaff7c6456559d0906a683d9a237bc9a","observation_id":"d91644aa-de97-4603-95b1-c07f60ea162c","resolution":{"observed_at":"2026-08-12T20:43:52.393482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-12T20:43:52.400851Z","title":"arXiv:2408.13257 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.400851Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:9c3be6659b4fa333aa38dcfab25b8fc4c25f0121cc78ac1759416c96ab415cf8","observation_id":"1f2d652b-157b-4059-91d6-65f866db853b","resolution":{"observed_at":"2026-08-12T20:43:52.400851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-08-14T01:06:41.049058Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-12T20:43:52.416078Z","title":"arXiv:2411.16044 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.416078Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:71f6e23a2afa94dc99a633d71edec53d3f7f6ec082b3b326b6f589d649d72d20","observation_id":"0f5c56c8-8f72-4ecc-aa61-adf9cc619201","resolution":{"observed_at":"2026-08-12T20:43:52.416078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.424324Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.424324Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:7cb598d6aaf4227983ec092e1fb0bd49966169f2ec056950afd0d4e7a93c5fe8","observation_id":"00f8f5af-5ac6-4ff0-8ffa-889a8f392f05","resolution":{"observed_at":"2026-08-12T20:43:52.424324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-12T20:43:52.433756Z","title":"arXiv:2505.15966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.433756Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:bbd5a08c67304505b2a43bed4581b367470472a7d0ef64bf929cb41620fcce38","observation_id":"c0689b02-576a-49c8-a73b-6c275db32d17","resolution":{"observed_at":"2026-08-12T20:43:52.433756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-12T20:43:52.446742Z","title":"Thinking with Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.446742Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5f6b3071f6ff5cbcc59b9ee4cfca3357cf442816bdf2007ca589b50eb92ae35f","observation_id":"b94ef19f-1956-4e41-9bb4-dd690d9ea07e","resolution":{"observed_at":"2026-08-12T20:43:52.446742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21457","last_updated":"2026-06-08T14:20:16Z","snapshot_observed_at":"2026-08-12T21:13:07.185581Z","submitted_at":"2025-05-27T17:29:31Z","title":"ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21457","snapshot_observed_at":"2026-08-12T20:43:52.454015Z","title":"arXiv:2505.21457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.454015Z"},"links":{"cited_paper":"/paper/2505.21457","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:1fb0c7edc4ca727a74efa26ec4fc50cfef7f194012ac78638f360302c603f626","observation_id":"ce597df7-ebfa-4f0c-8d61-2f0d1ef4599c","resolution":{"observed_at":"2026-08-12T20:43:52.454015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11991","snapshot_observed_at":"2026-08-12T20:43:52.464926Z","title":"arXiv:2506.11991 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.464926Z"},"links":{"cited_paper":"/paper/2506.11991","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5fac89b5425a82a04dd8cdf7747f0a953f9b3cd9f67532e84e9f94050639086a","observation_id":"dc73571a-e47c-4e93-9eeb-110b8ae226db","resolution":{"observed_at":"2026-08-12T20:43:52.464926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.484308Z","title":"arXiv:2507.07999 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.484308Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:61d30196dfc8ba6c8065d1650fa4eea8ea9ae66d4c1fc769ceaea724bf9bddd3","observation_id":"ad0030cf-a42d-4ce8-8e3e-6971391a36f7","resolution":{"observed_at":"2026-08-12T20:43:52.484308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-12T20:43:52.502221Z","title":"arXiv:2509.07969 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.502221Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:780b497c108fd2026e6d57cd4706ea962aef604dbbac552044ff1371b79c26a3","observation_id":"1773d0c5-1a6a-4ca3-92e4-f27f34bfb18c","resolution":{"observed_at":"2026-08-12T20:43:52.502221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.510847Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.510847Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e71cff3b51850f52eb4f0149b41839c3ffe472cacabf53231f6c07f304eada09","observation_id":"c5f4532a-b584-43fe-9bf3-55df8bd43554","resolution":{"observed_at":"2026-08-12T20:43:52.510847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21327","snapshot_observed_at":"2026-08-12T20:43:52.522901Z","title":"arXiv:2505.21327 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.522901Z"},"links":{"cited_paper":"/paper/2505.21327","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:377139eacf117c2e00170188a60099b2ac86aaf353752bc8be0fafc79c6f920a","observation_id":"50172d97-fd2b-4138-9d31-d88b5617db15","resolution":{"observed_at":"2026-08-12T20:43:52.522901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.539447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.539447Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4f4c7e5bc85c718508263063fbac380f356ac936221b31291c32157855502959","observation_id":"ee070561-45b4-48a0-ab0d-448755b802a0","resolution":{"observed_at":"2026-08-12T20:43:52.539447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.550508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.550508Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:18999b95ee7d02c1651126847a21e07018f0f51153e1a67db3d5c255cb2cdee6","observation_id":"c114a68c-6efe-4f03-8397-e2944ab09c4d","resolution":{"observed_at":"2026-08-12T20:43:52.550508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.560044Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.560044Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e512767ba293686dab0ebebb4ed3f99451c32cd61326ecdc904fa835d74a3076","observation_id":"693d7b3f-1597-431f-99c3-1fb96dd44458","resolution":{"observed_at":"2026-08-12T20:43:52.560044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.567430Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.567430Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e3353c3fcf6a936ff5d5d15aa17de0f26f0fd088a421d02270fc5943284cc12f","observation_id":"cef9870a-7f23-40af-bef9-f9708469379b","resolution":{"observed_at":"2026-08-12T20:43:52.567430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.581795Z","title":"2020 , publisher=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.581795Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:0a3fc43d0816d9d398e97c0cb6193b1c401c993edd7363d35060b85ec955c767","observation_id":"b27a5fc9-5082-4fa1-bfe0-cece2763f45a","resolution":{"observed_at":"2026-08-12T20:43:52.581795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.590870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.590870Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b9e6a587fe3ca8b0aa1bdda353fc86c97ef44e99ea8b082c42512ab4e83e74a0","observation_id":"bcf0e47d-cbee-4d5d-9958-8fbd5c1a854e","resolution":{"observed_at":"2026-08-12T20:43:52.590870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:10:50.592825Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":199},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 199 outbound references and 0 inbound Pith citation observations for arXiv:2608.10628."}