{"as_of":"2026-08-14T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c668a54146b60d261592b5aed2292bef21bd153ba92e4a1cf8f919965446ab1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:00:01.242564Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":"2311.11810","doi":"10.48550/arxiv.2311.11810","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"8 Fourier-VLM Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., Wu, Y ., and Ji, R","venue":"arXiv (Cornell University)","work_id":"59e37bff-3f93-4e48-8fd2-30b30846d0dd","year":2023},"citing_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-08-13T18:59:02.892834Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:21.695801Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2410.21169"},"observation_digest":"sha256:6a91d115cdb9faabc00aed4aac3dc1a140a1aa1bc29db303c3c21d247422beef","observation_id":"f677e5cb-599f-4cbd-89dd-f60b879fa1ce","resolution":{"observed_at":"2026-05-23T19:15:47.151987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-11T14:00:01.242564Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12626","last_updated":"2024-12-17T07:41:06Z","snapshot_observed_at":"2026-08-14T04:05:50.809701Z","submitted_at":"2024-12-17T07:41:06Z","title":"Improving the Transferability of 3D Point Cloud Attack via Spectral-aware Admix and Optimization Designs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:00:01.242564Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2412.12626"},"observation_digest":"sha256:a280b4c829c69081b60fcdd338a831a7eee7a4b77040b632f2ef225b09404cb2","observation_id":"314c322e-2660-409d-b6a2-e2cf72007ac9","resolution":{"observed_at":"2026-08-11T14:00:01.242564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":"2311.11810","doi":"10.48550/arxiv.2311.11810","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"8 Fourier-VLM Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., Wu, Y ., and Ji, R","venue":"arXiv (Cornell University)","work_id":"59e37bff-3f93-4e48-8fd2-30b30846d0dd","year":2023},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:79a987718d0929fcbe366afc86977af91f86cfb289c63699e20a109bec35c79b","observation_id":"82d49e9b-a8ca-4c02-923a-26fdc7ad9a2f","resolution":{"observed_at":"2026-05-17T20:33:26.782173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-10T22:17:27.570746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-14T06:27:37.289549Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.570746Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:4949aff19646e3da941eb3bfa8f86bf455481e7f9e7b6aea9d18b3f684174898","observation_id":"6cfec1f6-86e8-4190-8d26-71614137f408","resolution":{"observed_at":"2026-08-10T22:17:27.570746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-10T22:08:09.300421Z","title":"Doc- pedia: Unleashing the power of large multimodal model in the fre- quency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-14T01:36:58.632073Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:09.300421Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:8daa539df2a458040032ed50dd9c0696c91321251f82331e2929d52ce3d94e88","observation_id":"7a6621d5-08e8-4837-bc1d-0883e5d4fb2b","resolution":{"observed_at":"2026-08-10T22:08:09.300421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-07T22:57:16.806336Z","title":"Docpedia: Un- leashing the power of large multimodal model in the frequency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-10T19:15:26.138310Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.806336Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:10e3bf5b549865763ac3f75ae9f0d4f5a18e3da203e502016b37f808f43e65fa","observation_id":"1b59d5e2-d19b-4111-b093-d28a829d7925","resolution":{"observed_at":"2026-08-07T22:57:16.806336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-07T20:06:00.719912Z","title":"Docpedia: Unleashing the power of large multimodal model in the frequency domain for versatile document understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-08-10T18:50:32.127116Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T20:06:00.719912Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2502.09927"},"observation_digest":"sha256:90460c4799a33daff1f8a9280ca0c44e15116e8332ad8216bfea5eb69debb8ac","observation_id":"9b46aa39-9f48-4bed-ad26-c4d3a64a6e59","resolution":{"observed_at":"2026-08-07T20:06:00.719912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-07T15:29:17.350101Z","title":"Docpedia: Un- leashing the power of large multimodal model in the frequency domain for versatile document understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15154","last_updated":"2025-05-21T06:20:17Z","snapshot_observed_at":"2026-08-07T15:20:48.014264Z","submitted_at":"2025-05-21T06:20:17Z","title":"Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:17.350101Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2505.15154"},"observation_digest":"sha256:d84497ac23b3dc7d2483ad732c8097129f000c7a789a5de4804aa77167f88adc","observation_id":"d67a0b45-f1c7-4a4b-b3e0-80abe85dfc15","resolution":{"observed_at":"2026-08-07T15:29:17.350101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-06T21:19:37.883038Z","title":"Docpedia: Unleashing the power of large multimodal model in the frequency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00430","last_updated":"2025-07-01T04:59:26Z","snapshot_observed_at":"2026-08-14T02:37:19.011429Z","submitted_at":"2025-07-01T04:59:26Z","title":"MFH: Marrying Frequency Domain with Handwritten Mathematical Expression Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:37.883038Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2507.00430"},"observation_digest":"sha256:872f3c27350e28eafc8e8afa5e115fcd2474ed9e2abd89edd5ad65dd45f608ed","observation_id":"435b0314-42ff-4404-a945-1bfbaa361a9c","resolution":{"observed_at":"2026-08-06T21:19:37.883038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-06T20:39:36.874218Z","title":"Docpedia: Un- leashing the power of large multimodal model in the frequency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-11T00:15:03.159037Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.874218Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:735c67183afbc002739d8defd5f21f6a7b1bd5e473eb026789b747862fe2e9bf","observation_id":"a0c23f38-0caf-46c4-91e9-39e8418b7a07","resolution":{"observed_at":"2026-08-06T20:39:36.874218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":"2311.11810","doi":"10.48550/arxiv.2311.11810","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"8 Fourier-VLM Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., Wu, Y ., and Ji, R","venue":"arXiv (Cornell University)","work_id":"59e37bff-3f93-4e48-8fd2-30b30846d0dd","year":2023},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-08-13T06:49:01.011003Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:c520e112d4a72d2ba6f43c54cb93a3fa56c76bfb05a3d4c2d8612872a627c628","observation_id":"a9b00e8c-c3ad-4fb9-8ccc-e39fec10fd51","resolution":{"observed_at":"2026-05-19T04:42:04.059565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-06T15:57:00.673034Z","title":"Docpedia: Unleashing the power of large multimodal model in the frequency domain for versatile document understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14675","last_updated":"2025-07-19T16:03:34Z","snapshot_observed_at":"2026-08-12T01:30:38.455355Z","submitted_at":"2025-07-19T16:03:34Z","title":"Docopilot: Improving Multimodal Models for Document-Level Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:00.673034Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2507.14675"},"observation_digest":"sha256:6b5bc27d3284b4a3a80864a77faf317f6608f2e9bfcce834b52ce2fc521f3778","observation_id":"20a09f63-9701-414a-a48d-c2af8715b858","resolution":{"observed_at":"2026-08-06T15:57:00.673034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":"2311.11810","doi":"10.48550/arxiv.2311.11810","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"8 Fourier-VLM Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., Wu, Y ., and Ji, R","venue":"arXiv (Cornell University)","work_id":"59e37bff-3f93-4e48-8fd2-30b30846d0dd","year":2023},"citing_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T22:40:39.892802Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2508.06038"},"observation_digest":"sha256:a320011c264c9d733b68994a61e25af22235134de66886e23af7ae479e98b029","observation_id":"9cbaacce-12e0-474c-8aa0-f1d862ddba20","resolution":{"observed_at":"2026-05-21T22:40:43.024304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":"2311.11810","doi":"10.48550/arxiv.2311.11810","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"8 Fourier-VLM Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Yang, J., Zheng, X., Li, K., Sun, X., Wu, Y ., and Ji, R","venue":"arXiv (Cornell University)","work_id":"59e37bff-3f93-4e48-8fd2-30b30846d0dd","year":2023},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-08-14T02:11:00.981613Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:32.238241Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:97212961c37de253583fdb63f4e447ffbcb5db2c38567834ee9eb398a3fd553d","observation_id":"72be1701-116c-4c85-b92f-2d999396beb4","resolution":{"observed_at":"2026-05-20T10:53:13.098663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-07-12T16:34:34.452430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-08-14T02:11:00.981613Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T16:34:34.452430Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:f6e1e36d599f2ef0eb20749ff25a8851b7ca457c7d263470aab8c1984c0cdae7","observation_id":"4ef64414-b84c-47bc-b9a1-4dafa3b11397","resolution":{"observed_at":"2026-07-12T16:34:34.452430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.11810/citation-record","integrity":"/paper/2311.11810/integrity","json":"/paper/2311.11810/citation-record.json","paper":"/paper/2311.11810"},"outbound":[],"paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:21:52.863037Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2311.11810."}