{"as_of":"2026-08-11T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d85d5d0e41627a0e409a045fe805389e8a75371648d259c8af1804c82b311a68","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:47:40.108730Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T17:57:52.084110Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T18:02:42.492424Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"cited_work":{"arxiv_id":"2506.21600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.21600 (2025)","venue":null,"work_id":"7f77510c-86be-4310-a431-6bec6270abbf","year":2025},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2506.21600","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:af175dcfc39dca39ac688439e189a38cf7ba20b17895c53165e2836820432cc8","observation_id":"7d9945e1-f706-42c4-ab82-c9d1b362c3f6","resolution":{"observed_at":"2026-05-10T23:15:50.268399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"cited_work":{"arxiv_id":"2506.21600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.21600 (2025)","venue":null,"work_id":"7f77510c-86be-4310-a431-6bec6270abbf","year":2025},"citing_paper":{"arxiv_id":"2605.15223","last_updated":"2026-05-13T08:36:57Z","snapshot_observed_at":"2026-08-03T00:31:17.013638Z","submitted_at":"2026-05-13T08:36:57Z","title":"GenAI-Driven Approach to RISC-V Supply Chain Exploration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T17:57:52.084110Z"},"links":{"cited_paper":"/paper/2506.21600","citing_paper":"/paper/2605.15223"},"observation_digest":"sha256:f7655f0efbc021494088044bfcfe23b25c757b8dc411e0e92bd95f912e94820a","observation_id":"20f42834-92cd-4a98-8b25-b80d443d2d51","resolution":{"observed_at":"2026-05-19T18:02:42.493996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21600/citation-record","integrity":"/paper/2506.21600/integrity","json":"/paper/2506.21600/citation-record.json","paper":"/paper/2506.21600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T23:47:36.566350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:36.566350Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:cbd40b62196d15de6a0240c4a1605a34f86848e16d293911cd8ad8edb7922dd0","observation_id":"8acd3730-8961-4a10-b342-12ef1c3cf138","resolution":{"observed_at":"2026-08-06T23:47:36.566350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:41.450700Z","title":null,"venue":null,"work_id":"3b23be23-aa93-4131-92cc-49b5cd0e05f1","year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:36.657341Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:671c785ba5745d3dcb33c9c3cba7c4c9b14e0aedc0e53ccfc48ff60b10eff880","observation_id":"30a5f94e-8089-4023-aafe-5992018c9785","resolution":{"observed_at":"2026-08-06T23:47:41.547846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T23:47:36.875706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:36.875706Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:6fd3a3971f2b97456efef8bcfabc151b1a95434390e12fe66ea5749342f54da5","observation_id":"0600b700-e1d4-4e72-8565-2a090f881c25","resolution":{"observed_at":"2026-08-06T23:47:36.875706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-10T18:05:01.074940Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-06T23:47:37.029513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.029513Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:61cf32fa665d7f433207de94e590ce9d9463bd6bdcdf8e74301127330ae3aeab","observation_id":"cc0b3ef1-c3a8-45bf-98d5-2e55cdffdfb5","resolution":{"observed_at":"2026-08-06T23:47:37.029513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21439","last_updated":"2024-09-25T06:14:03Z","snapshot_observed_at":"2026-07-06T18:54:54.118506Z","submitted_at":"2024-07-31T08:43:17Z","title":"MLLM Is a Strong Reranker: Advancing Multimodal Retrieval-augmented Generation via Knowledge-enhanced Reranking and Noise-injected Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21439","snapshot_observed_at":"2026-08-06T23:47:37.157188Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.157188Z"},"links":{"cited_paper":"/paper/2407.21439","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:d03f4101811543abea7fa884fe34d96b931e96d28f49627d0d1a10d7e7bbdceb","observation_id":"218b0545-9730-4ecd-87a5-7850e7bc3386","resolution":{"observed_at":"2026-08-06T23:47:37.157188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:37.248482Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.248482Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:f09db0dd0ee0e1611bc3ba6fc8718cb4ab065f8dbedf455dda5dc1ce36715580","observation_id":"b077fc46-2dbd-4faf-b1fd-3de8e4d6d3c6","resolution":{"observed_at":"2026-08-06T23:47:37.248482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-08-11T03:20:35.146270Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-06T23:47:37.341207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.341207Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:45d111be7ba83deade8eb07f28d14bfd63d7a5f61d19ddab138fa81f09dcca3c","observation_id":"9cac0801-9dc0-44f0-8672-3fb25f9d59a4","resolution":{"observed_at":"2026-08-06T23:47:37.341207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18424","last_updated":"2025-07-15T17:55:08Z","snapshot_observed_at":"2026-08-10T23:59:37.415924Z","submitted_at":"2024-12-24T13:39:32Z","title":"LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18424","snapshot_observed_at":"2026-08-06T23:47:37.435685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.435685Z"},"links":{"cited_paper":"/paper/2412.18424","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:fb1011a1c89a3cbff1e0ce8ef652a27f1dc8584f9a5e886a84838682e036f894","observation_id":"557e9e11-9923-40e7-ab49-7003a7901d62","resolution":{"observed_at":"2026-08-06T23:47:37.435685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:41.257154Z","title":null,"venue":null,"work_id":"39dacef3-17f0-4836-9cad-ed1aec424b9a","year":2022},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.571320Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:d029320a892c46dd6bba531490fc910309a41672f1eb9666426295d728d6be15","observation_id":"c149758f-e1cf-48a9-93a7-df7ed2b5513e","resolution":{"observed_at":"2026-08-06T23:47:41.365001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:41.082068Z","title":null,"venue":null,"work_id":"b0ba74dc-ac7c-4413-8904-81058fa8bb9d","year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.737502Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:7dd1b8cbd8d223b6f6ead677fa679cbb9bd1c3d39124db0641f9aa157d1c0d3b","observation_id":"930e6e95-fd3f-40d4-aba1-44aa6cc5134f","resolution":{"observed_at":"2026-08-06T23:47:41.188742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.881839Z","title":null,"venue":null,"work_id":"ab94d601-e247-45a0-b808-a4030d68226e","year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.851387Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:4720b029c1ecaaa50822135c7723c5a1834bf8e4e870174f764b0b3b3b251eb8","observation_id":"bef3c24d-2df9-44be-96b1-744e84eb9ba4","resolution":{"observed_at":"2026-08-06T23:47:40.966549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-06T23:47:37.917233Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.917233Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:1c3d57d8990479fc2d077d10333fd013dc1e91549bf5e5e5aa6341377884f56a","observation_id":"a3cc50d5-40d3-4842-8a6f-5866ae0646cb","resolution":{"observed_at":"2026-08-06T23:47:37.917233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13964","last_updated":"2025-03-18T06:57:21Z","snapshot_observed_at":"2026-08-07T16:55:45.055075Z","submitted_at":"2025-03-18T06:57:21Z","title":"MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13964","snapshot_observed_at":"2026-08-06T23:47:37.986765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.986765Z"},"links":{"cited_paper":"/paper/2503.13964","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:0dbfc553fa191656a7661829804f477fa3cde41caf5ca3c446c9d558c9741227","observation_id":"412043ba-676f-4dd1-b790-7765516916aa","resolution":{"observed_at":"2026-08-06T23:47:37.986765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-06T23:47:38.065585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.065585Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:c4d2b1f7754e4a903fbfca3cd23bdb650f0120d844c280415ce2a837a5b60dda","observation_id":"57b3f667-02d7-41d7-844d-fc169ac4be3f","resolution":{"observed_at":"2026-08-06T23:47:38.065585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15187","last_updated":"2024-10-31T10:10:28Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T14:29:39Z","title":"UDA: A Benchmark Suite for Retrieval Augmented Generation in Real-world Document Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15187","snapshot_observed_at":"2026-08-06T23:47:38.127865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.127865Z"},"links":{"cited_paper":"/paper/2406.15187","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:ec388d30fb4d9024f66620b9df3f90ed539613a9e037e0c3b0de27df60fe372f","observation_id":"bc40964e-1550-4d09-b463-3499dcb808a3","resolution":{"observed_at":"2026-08-06T23:47:38.127865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.192562Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.192562Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:b5745f10c3d800f4d096898d4e19fa39a1a8f2a43b5c62f3176806d101de83bd","observation_id":"239b6cb1-c075-4c1e-bba7-b8492bc6a064","resolution":{"observed_at":"2026-08-06T23:47:38.192562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.260351Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.260351Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:fa4e23370bb0600b6e2c0db6627d84c9b244bb9a92df58dca18475cf915d27b6","observation_id":"2eec2257-a166-4c77-9288-4436926707e2","resolution":{"observed_at":"2026-08-06T23:47:38.260351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-06T23:47:38.340852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.340852Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:b49c0bac46626936771a739d852fc340a47052a9c9f53ae964268075e794c4dd","observation_id":"9aa53227-272b-4a98-a7e1-e2a0188a9358","resolution":{"observed_at":"2026-08-06T23:47:38.340852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.403982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.403982Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:dd87e818f3b566d6ef736ab12b80cd5a09456cb076921340c4451e69600e56b5","observation_id":"ebc8cab7-81b4-492d-88e4-331a0e42a767","resolution":{"observed_at":"2026-08-06T23:47:38.403982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.468043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.468043Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:8fcceb73be35eb951af9e2acdf65e19a23b5248131cf9a042be669f06e4f9b20","observation_id":"2990d5ee-d5e0-4891-a994-6db0ccb3a5a5","resolution":{"observed_at":"2026-08-06T23:47:38.468043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T23:47:38.535627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.535627Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:89ea288919d8d7ee242e06e82469e1448ea0bf3dabbca50a6a07a2ae8b79d7e3","observation_id":"0a80537c-96f4-40f2-b0c5-5b88f29a12bf","resolution":{"observed_at":"2026-08-06T23:47:38.535627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14213","last_updated":"2024-08-26T04:59:05Z","snapshot_observed_at":"2026-08-10T18:27:52.233583Z","submitted_at":"2024-05-23T06:17:23Z","title":"From Text to Pixel: Advancing Long-Context Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14213","snapshot_observed_at":"2026-08-06T23:47:38.551116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.551116Z"},"links":{"cited_paper":"/paper/2405.14213","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:3b5fc80e768e86d5389825ca5ca6a8e12a5409b42688b5e3fc7be34cb3bacff6","observation_id":"d6017804-7895-448c-a87a-29dde3b08fba","resolution":{"observed_at":"2026-08-06T23:47:38.551116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-08-06T23:47:38.698127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.698127Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:818d1342fd651028e99026fbbe52a9bf3edff9ef500d762b1a0d2ed8ba040a08","observation_id":"79f003c5-613d-490b-919f-c1a4b29a166a","resolution":{"observed_at":"2026-08-06T23:47:38.698127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.746488Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.746488Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:c4af15e85b3e02556691e05ec9f81f9dcb01734dc0b46f6f97507d87b5eee342","observation_id":"b1ca93ba-e2ea-40ef-a9fa-ae333345dcc7","resolution":{"observed_at":"2026-08-06T23:47:38.746488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.889106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.889106Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:87d03f1e055eb7c87483c52fcede2eecc4ccf32c921745e4132b6c79fa505bb4","observation_id":"d8faca11-f4e7-4fca-9394-9ae8d4b3c52c","resolution":{"observed_at":"2026-08-06T23:47:38.889106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10704","last_updated":"2025-02-11T07:05:58Z","snapshot_observed_at":"2026-08-09T14:02:25.037267Z","submitted_at":"2024-12-14T06:24:55Z","title":"VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10704","snapshot_observed_at":"2026-08-06T23:47:38.950010Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.950010Z"},"links":{"cited_paper":"/paper/2412.10704","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:e1d21f22ed506758a8b7c0da81b133ff5f7de7091dcda0fa6cb4749872a7c582","observation_id":"ff12f5d0-58bc-4e1d-b5f3-148668ad2fd0","resolution":{"observed_at":"2026-08-06T23:47:38.950010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T23:47:39.053741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.053741Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:2aedf7d8152544f864394384875c86bf6c9834ad37bd905260e35981e63a77c5","observation_id":"19f8b03b-c390-4246-bd4f-b382c59da653","resolution":{"observed_at":"2026-08-06T23:47:39.053741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:39.158696Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.158696Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:7e5ffc602c34b15bbcb448a371da048db6d6f27cb09ac3c60a2bfbbe6259b75f","observation_id":"b047a5f4-3c5b-48f0-ad3a-3f8577e8d406","resolution":{"observed_at":"2026-08-06T23:47:39.158696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:39.293516Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.293516Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:8f3e1303b4a874a238cd0b51bfd0e2998ccf4de3d28db654ac22c5075e635581","observation_id":"be76b27f-c18f-47c7-b5b5-5781ca506340","resolution":{"observed_at":"2026-08-06T23:47:39.293516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.685785Z","title":null,"venue":null,"work_id":"d3be8e35-bde2-47f8-be56-7631ae3f7539","year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.392380Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:0b4b8c12125e6b4687d7e66b4953ca775363910ea0ab6fb9d5925d4229ec5272","observation_id":"7c8db10b-9047-42fc-952b-08b260ff7073","resolution":{"observed_at":"2026-08-06T23:47:40.770888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:47:39.500538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.500538Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:d0e70ec6d15ce626dacafb1a98fde115d22eee1119bfb4f18d15e4b56b7e1fb5","observation_id":"ec82f0cf-2614-4cab-a515-ea9b2e0d0c18","resolution":{"observed_at":"2026-08-06T23:47:39.500538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.458902Z","title":null,"venue":null,"work_id":"0aaa6bef-0eb6-4647-82d1-57406bf6c5f6","year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.580634Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:a35c7abc42f60387cd16e7ded50984bd5a41dac39a09c2aac9dcea5aaffcdd18","observation_id":"82d1ece3-d31b-495e-8403-dbc485ef6800","resolution":{"observed_at":"2026-08-06T23:47:40.560631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-11T01:12:48.131694Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-06T23:47:39.656467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.656467Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:74c047f5f1ea36fbc124e2d236f835263ad4c7e2de5f138745404f7d25900403","observation_id":"f6d2e2b8-8e95-45c1-8ff7-cd7cace1d5df","resolution":{"observed_at":"2026-08-06T23:47:39.656467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02592","last_updated":"2025-08-30T07:10:08Z","snapshot_observed_at":"2026-08-07T19:18:09.165929Z","submitted_at":"2024-12-03T17:23:47Z","title":"OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02592","snapshot_observed_at":"2026-08-06T23:47:39.775273Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.775273Z"},"links":{"cited_paper":"/paper/2412.02592","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:f5a3b746a1a5901bdafa7f1884b78e81157f4ec154c20c70cbdeecd44239d0b8","observation_id":"c30a6f23-c116-4a52-8b63-fd0d3e0629e1","resolution":{"observed_at":"2026-08-06T23:47:39.775273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-10T17:10:48.855057Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-06T23:47:39.833498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.833498Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:dad4bed4adbd3e18ac3d206893e98b18d5857f5e8d37a5c9f9ad51f35ce73997","observation_id":"de3b0a21-a37f-471b-b485-d88fd6c34fe7","resolution":{"observed_at":"2026-08-06T23:47:39.833498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T23:47:39.913987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.913987Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:686ee41b8dae910d4558828189bddb3c3a28c9481bc094d21d3784d6a30c8fcc","observation_id":"7a4a81ef-f858-4a2b-89e4-0bbc5135869a","resolution":{"observed_at":"2026-08-06T23:47:39.913987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.022629Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:40.022629Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:95c939a71ed4627516530aa41a633abfecf042d03cc245f8c76cdf75e542253c","observation_id":"a140df1b-6ba0-4536-8ff6-00458565147a","resolution":{"observed_at":"2026-08-06T23:47:40.022629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.108730Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:40.108730Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:8a8f6a85adf155856d5df94bbf1a5ae9c83b88cd6f893c00de59437de55e49ed","observation_id":"822ab7c7-3dac-4a47-b228-fcb439828671","resolution":{"observed_at":"2026-08-06T23:47:40.108730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T00:01:38.513352Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2506.21600."}