{"as_of":"2026-08-20T12:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd429268a7ca8a208770b5086bbf0ac221c52dd2220f8ddd17da4eb35b43660d","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:20:55.617728Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.07496/citation-record","integrity":"/paper/2505.07496/integrity","json":"/paper/2505.07496/citation-record.json","paper":"/paper/2505.07496"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.453215Z","title":"Generic attention-model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":"925e434c-58d1-43ea-8853-39c43eeb5279","year":2024},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.462731Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:f44caa28afbfb81c5dcb35f8724d97f88b4de8f8b49ec5aab4facb4925eb9e9e","observation_id":"53ccad90-0918-4431-8100-827c215b6a88","resolution":{"observed_at":"2026-08-15T22:20:56.465601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:55.482340Z","title":"Boundingdocs: a unified dataset for document ques- tion answering with spatial annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.482340Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:8992ecc7590c811c0dbb5e208982de1fb8a079d571bd95e5d32c49687de9cf44","observation_id":"731f18de-faa4-4d1e-a6da-2c2eb5978ce4","resolution":{"observed_at":"2026-08-15T22:20:55.482340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.416842Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":"5e56bc95-5631-4685-b77d-39e259996c96","year":2016},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.491078Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:13195b5de6b12aba698b23e6a55c0fe14ec881942264b2a49265b798e6825444","observation_id":"8c4822b9-8157-4717-b31a-f99ff48284b3","resolution":{"observed_at":"2026-08-15T22:20:56.431440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-16T17:38:06.620846Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-15T22:20:55.501331Z","title":"Donut: Document understanding transformer without ocr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.501331Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:a8ec0854e66dd987bd8401b836c8ef15ad68c7f9eb7417a93fdac43e8228f7d2","observation_id":"228ea04c-f6a4-444a-8d10-0d89d52dcd7d","resolution":{"observed_at":"2026-08-15T22:20:55.501331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-15T17:53:32.952905Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-08-15T22:20:55.508545Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.508545Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:6fe1fc9e6bdafac369bbe82da182c212df608a187dbef658a97902c48b122810","observation_id":"50d69133-2e62-46a1-b872-d4e5c69a1eee","resolution":{"observed_at":"2026-08-15T22:20:55.508545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07421","last_updated":"2018-09-25T18:16:18Z","snapshot_observed_at":"2026-08-16T23:44:59.708767Z","submitted_at":"2018-06-19T18:41:30Z","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07421","snapshot_observed_at":"2026-08-15T22:20:55.514545Z","title":"Rise: Randomized input sampling for explanation of black-box models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.514545Z"},"links":{"cited_paper":"/paper/1806.07421","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:96e6a5d70bc57011a0342c0f836357c8c4958827ba2f8b0ea475dbd63dc6ddf2","observation_id":"65b6a538-e5ba-4f6e-92cc-d05b1f813221","resolution":{"observed_at":"2026-08-15T22:20:55.514545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.00396","last_updated":"2020-05-25T14:21:37Z","snapshot_observed_at":"2026-08-17T20:52:06.084435Z","submitted_at":"2020-01-02T11:24:35Z","title":"Restricting the Flow: Information Bottlenecks for Attribution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.00396","snapshot_observed_at":"2026-08-15T22:20:55.525865Z","title":"Re- stricting the flow: Information bottlenecks for attribution","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.525865Z"},"links":{"cited_paper":"/paper/2001.00396","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:dc151f1f537bb775d4f37b9e13c1c9f4a3ed9ddf89b67925936ea55d91c1227d","observation_id":"216c03c6-f709-4e15-9c70-7802154f98f8","resolution":{"observed_at":"2026-08-15T22:20:55.525865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:55.542922Z","title":"and Zaslavsky, N","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.542922Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:6de73fcb9acd5f1d04ca0f15f6b1e890cdfe525b27c81fab2cf303a96be2b55a","observation_id":"26054521-2672-4f7a-91c7-c44b71331846","resolution":{"observed_at":"2026-08-15T22:20:55.542922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T22:20:55.550363Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.550363Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:0da6634e096d70c91a9c668f86e0086b5b333883a0986de5e87dc057a916d875","observation_id":"f4497f33-82ce-4b55-bb37-ade4f7b1e42e","resolution":{"observed_at":"2026-08-15T22:20:55.550363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-08-14T12:54:48.492396Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-15T22:20:55.556647Z","title":"Bloomberggpt: A large language model for finance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.556647Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:8fd5e8463a987ce95275c7d28503ac261fb580e00ca861074b29ef9e3e18bd47","observation_id":"d6c3ca94-d4e3-4fb5-872f-15a01aae2030","resolution":{"observed_at":"2026-08-15T22:20:55.556647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.310838Z","title":"Ureader: Universal ocr- free visually-situated language understanding with mul- timodal large language model","venue":null,"work_id":"d8c575c4-f47b-4092-b68b-24c6a1294758","year":2023},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.567697Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:9cc2deb08d5a3e0e680c7eb38e129122a6a7d5d391aad72ef1c4e27aac5a9882","observation_id":"df02263a-dd65-45c2-bcc9-69d5f1d4e977","resolution":{"observed_at":"2026-08-15T22:20:56.317658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-13T17:45:25.269133Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-15T22:20:55.572823Z","title":"Visrag: Vision- based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.572823Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:da50b5a9412e2344b49e3faaaecd41b0e666b8a1f3a03612115bfc442baeb75f","observation_id":"17f8a9a6-7494-4da2-b652-24b983d1758a","resolution":{"observed_at":"2026-08-15T22:20:55.572823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-17T21:31:00.017761Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-15T22:20:55.581390Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.581390Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:510e229432f2158d443f250da61cb4e9dc826fe1a0308c0dacad9b1cb1f4a9f0","observation_id":"baae48cf-7a19-480a-85a7-c790be202208","resolution":{"observed_at":"2026-08-15T22:20:55.581390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.287218Z","title":"Information- bottleneck approach to salient region discovery","venue":null,"work_id":"2f8d6c7e-8d31-4010-a191-1553ce59dff7","year":2020},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.588819Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:311c5afa4d5289ee0b9921110cdba9216bd9a575b595c1a4cf3861395c23f5d8","observation_id":"cdc4c2b7-73f9-4bd4-9929-64439535314a","resolution":{"observed_at":"2026-08-15T22:20:56.295631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.252922Z","title":"What is the estimated budget of ‘conduct analysis of decision makers/ information targets’ in research and development?","venue":null,"work_id":"9dd7bb57-192b-4a7d-b742-51220c0ac549","year":2021},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.603675Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:7ff3d32f5c451133db50fec12cd794b29da198d313e21024d1fec0cffcc26e94","observation_id":"abf98399-42f0-4e09-9188-fe066685ed1d","resolution":{"observed_at":"2026-08-15T22:20:56.267328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.215172Z","title":"Left: Original Image","venue":null,"work_id":"92f59d11-60b7-44a7-b99a-ce001ba8f150","year":2022},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.610564Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:4dae5334e86eb798fe35a4bf442e1563be0909b4bfb832e09ece4d49914d7211","observation_id":"051f3bb3-236e-4a1c-b777-adb9779bee16","resolution":{"observed_at":"2026-08-15T22:20:56.223831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.184974Z","title":"19 DocVXQA: Context-Aware Visual Explanations for Document Question Answering B.4","venue":null,"work_id":"9e371c36-dc6f-4bb8-b25c-38324c9126b2","year":2021},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.617728Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:9394028758ce50d3fe3e0cb336cbe679a3b6341b420695c2118fd91e7e61eea8","observation_id":"83592a09-1df0-40e6-a35d-773142db9c8d","resolution":{"observed_at":"2026-08-15T22:20:56.196295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.383129Z","title":"Going full-tilt boogie on document understanding with text-image-layout trans- former","venue":null,"work_id":"3ebf3e07-b60b-4139-a7c5-9b21e816bbb4","year":2021},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.520540Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:8d64d0bb7d48b26a3a9fcbede6b9d9f38746ca615bd556ba46f7b4c0d16b69dd","observation_id":"f9055a96-c353-4dc9-a1f1-10a86e13904e","resolution":{"observed_at":"2026-08-15T22:20:56.393947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:20:55.439460Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.439460Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:953fd369ba9b5c2011d0bdb3b3f6bacea39a50529eed5d13c7531f24e3ff58cc","observation_id":"beb65caf-fdfe-49b9-b004-237469a89fa0","resolution":{"observed_at":"2026-08-15T22:20:55.439460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17125","last_updated":"2025-08-06T10:02:43Z","snapshot_observed_at":"2026-08-16T05:35:53.531757Z","submitted_at":"2024-11-26T05:38:34Z","title":"DOGR: Towards Versatile Visual Document Grounding and Referring","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17125","snapshot_observed_at":"2026-08-15T22:20:55.593869Z","title":"Doge: Towards versatile vi- sual document grounding and referring","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.593869Z"},"links":{"cited_paper":"/paper/2411.17125","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:a04b49b261259495482dd0f485b1c2e1a8caf1ee23248247bc2e13b4cb0a575a","observation_id":"accb5211-bd9b-4273-870a-f2ef7a501548","resolution":{"observed_at":"2026-08-15T22:20:55.593869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-08-18T08:16:35.995611Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-15T22:20:55.471606Z","title":"Colpali: Efficient document retrieval with vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.471606Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:e1992e5e9065468b09d689165fc1aea1e2779ff42a17ccca00f290121d225ff2","observation_id":"c3206f81-efb9-47c3-b7e0-3fcf6fa76e6b","resolution":{"observed_at":"2026-08-15T22:20:55.471606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14218","last_updated":"2023-10-27T15:08:31Z","snapshot_observed_at":"2026-08-20T11:12:19.246509Z","submitted_at":"2023-05-23T16:34:09Z","title":"DUBLIN -- Document Understanding By Language-Image Network","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14218","snapshot_observed_at":"2026-08-15T22:20:55.447545Z","title":"M., 9 DocVXQA: Context-Aware Visual Explanations for Document Question Answering Liu, Q., Choudhury, M., Chauhan, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.447545Z"},"links":{"cited_paper":"/paper/2305.14218","citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:27e82dc57f58efad8edcfc62eb3624c55f6b2310978e3ccd9b10e133ec76ffc6","observation_id":"63963266-9f37-4665-ac08-05d53514afa0","resolution":{"observed_at":"2026-08-15T22:20:55.447545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.478534Z","title":"Weighted anisotropic– isotropic total variation for poisson denoising","venue":null,"work_id":"83b2342f-bc0e-4631-94f2-7d411f48dd51","year":2023},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.455074Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:6f9c3e39258aa315ebdcf6ce9f758e025297fd4a5e8af30b9c83965816f514c4","observation_id":"3d8d1ca1-dfdf-4211-89f8-4c3ed4df3452","resolution":{"observed_at":"2026-08-15T22:20:56.485336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:20:56.348903Z","title":"and Flach, P","venue":null,"work_id":"ef467f93-d06b-47c8-a95c-8cc24f2e455b","year":2020},"citing_paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T22:20:55.535236Z"},"links":{"citing_paper":"/paper/2505.07496"},"observation_digest":"sha256:752ff0e66000ac7ea42f5178f86575c6019b1375a7b1e49de679cec842ae8cb7","observation_id":"5d983e6a-5922-463c-8701-8dd7614c4827","resolution":{"observed_at":"2026-08-15T22:20:56.370426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07496","last_updated":"2025-05-12T12:30:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T20:51:46.979846Z","submitted_at":"2025-05-12T12:30:16Z","title":"DocVXQA: Context-Aware Visual Explanations for Document Question Answering"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2505.07496."}