{"as_of":"2026-08-10T04:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd84d31811aa438d89f74bfa2dee329c5d4773479e1f1421c04a0e3a6e66a9f5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:14:20.479979Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:ae6d7f0029acfbf8b7cbaf20a2548eecfe55db6a653e7c491bf2bfbc41d28d14","observation_id":"2c0cffd4-9796-468c-9105-a91c41822bbc","resolution":{"observed_at":"2026-05-16T07:59:32.703331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":228,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:595211bf27969741dd12f28e204304816fe4abadc59becdd6e0ad7fefca6c0bd","observation_id":"0bc929f0-7cd8-4d2c-a166-8b4f02b75fa7","resolution":{"observed_at":"2026-05-10T13:23:58.036152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-09T18:14:20.479979Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00665","last_updated":"2025-02-02T04:37:25Z","snapshot_observed_at":"2026-08-09T18:06:58.908071Z","submitted_at":"2025-02-02T04:37:25Z","title":"Cross-Modal Synergies: Unveiling the Potential of Motion-Aware Fusion Networks in Handling Dynamic and Static ReID Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T18:14:20.479979Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2502.00665"},"observation_digest":"sha256:d1cbd88955e3aea28f2668222a97248f9883ac4d80d62b4714d18fbed226ce36","observation_id":"d65ed6ca-8fed-4637-9dbd-badccf0998b8","resolution":{"observed_at":"2026-08-09T18:14:20.479979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-09T15:56:19.626881Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01280","last_updated":"2025-02-19T11:13:18Z","snapshot_observed_at":"2026-08-10T00:57:57.216323Z","submitted_at":"2025-02-03T11:51:24Z","title":"Trajectory Map-Matching in Urban Road Networks Based on RSS Measurements","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T15:56:19.626881Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2502.01280"},"observation_digest":"sha256:27716c21d79cd7f7cafe8004cc11da0300e58a064d5789b49864f4b7aeb74ccc","observation_id":"ebb1b6e8-f7fb-468b-9459-b4bfb34acc37","resolution":{"observed_at":"2026-08-09T15:56:19.626881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:af255ae4ba4ebdc2253efcaac73813d5580269ed3b6620e3ad4de9a64b5efa09","observation_id":"38269d09-3bca-4cbd-8bb8-73503b83363f","resolution":{"observed_at":"2026-05-17T05:53:26.122658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:0cc38c6ad784133407391940e7076e7aba93b412ca6761f1b6f4b7f08570704e","observation_id":"61cd1887-8c50-4ebe-85e3-3ea3c9b7988c","resolution":{"observed_at":"2026-05-23T02:25:19.101037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:87d90233bf399eeab2ab160ce968d4e1481d2a22f187027f2f7984cf623f4892","observation_id":"b33f1460-4f7d-43ab-8b0d-7e224e99433d","resolution":{"observed_at":"2026-05-10T13:41:08.096968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-07T15:42:27.648631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-08T07:54:09.757528Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:27.648631Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:6fa85f2c089fe974022ce23bc30a56904d915bae1d9693d494386bf86eece89c","observation_id":"5c42ea2b-b3de-4070-8fb4-ef412deb4b9d","resolution":{"observed_at":"2026-08-07T15:42:27.648631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-07T14:53:09.826103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17374","last_updated":"2025-05-23T01:12:57Z","snapshot_observed_at":"2026-08-07T21:48:37.451690Z","submitted_at":"2025-05-23T01:12:57Z","title":"Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:09.826103Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2505.17374"},"observation_digest":"sha256:67b01197a3e3d413a9f7f49505bc20756bf32c4ef6e5e9e2945534ae096df46a","observation_id":"8f0e8020-f461-475d-83dd-13ddd401c8bc","resolution":{"observed_at":"2026-08-07T14:53:09.826103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-06T18:19:58.185565Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08719","last_updated":"2025-07-11T16:19:53Z","snapshot_observed_at":"2026-08-07T04:09:15.037517Z","submitted_at":"2025-07-11T16:19:53Z","title":"Multilingual Multimodal Software Developer for Code Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.185565Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2507.08719"},"observation_digest":"sha256:025708db3a10ccd58916580f413466ff15642de887200a33101219fcf7a13749","observation_id":"03f0d185-6e7d-4775-a7bf-4f27119e219c","resolution":{"observed_at":"2026-08-06T18:19:58.185565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:017c835f743a1592df26c250edff95bee45c5b010ddac806561113bc0483267d","observation_id":"4ddae192-bd41-49eb-aed9-21f4a513d996","resolution":{"observed_at":"2026-05-10T11:58:58.775085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2509.10026","last_updated":"2026-04-14T03:34:18Z","snapshot_observed_at":"2026-07-06T22:29:06.119014Z","submitted_at":"2025-09-12T07:45:44Z","title":"LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T17:53:08.136677Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2509.10026"},"observation_digest":"sha256:36e5b99e986ec5cb57e4f63a169141ed165f7f2dd8ae6f77abedff77fb327634","observation_id":"fa77b7a4-1134-4c0f-9ab0-63b9d36b2162","resolution":{"observed_at":"2026-05-18T17:56:42.310528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2509.22123","last_updated":"2026-05-13T12:28:55Z","snapshot_observed_at":"2026-08-08T13:18:54.000166Z","submitted_at":"2025-09-26T09:46:13Z","title":"Multilingual Vision-Language Models, A Survey","version":2},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-05-18T13:02:08.000814Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2509.22123"},"observation_digest":"sha256:22ac3c93a6c17769c3479eaae18fb4fc217bf7ef86c97f65a42a434437964154","observation_id":"34fb4af9-5580-4886-ad1e-d1a63464aaad","resolution":{"observed_at":"2026-05-18T13:02:37.275213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-03T10:43:50.130815Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-08T18:45:43.759614Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.130815Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:d54f5559855e7b1de13e08f7ec3afb961dda1c508fd20dfcaa4187a90a39a322","observation_id":"9f3b2e45-ec2a-407a-b6f0-eaddc4eb220f","resolution":{"observed_at":"2026-08-03T10:43:50.130815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-03T10:43:42.114265Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-07T05:38:49.409741Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.114265Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:dcb60769e9de027f97e62285a67bc7a1cbf5105cf95b9e19ebe379b0ff5a871f","observation_id":"111207c7-2583-48df-907a-babeb134fe9c","resolution":{"observed_at":"2026-08-03T10:43:42.114265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.03339","last_updated":"2026-04-03T07:59:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T07:59:26Z","title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T20:01:57.029143Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.03339"},"observation_digest":"sha256:ce3b84077837e3124ce852933a73fd571a0aff3ae7ea7f8d980569be9cd3db0b","observation_id":"cf8efb61-fa51-4edd-884f-b7ca1d56c4e0","resolution":{"observed_at":"2026-05-13T20:03:12.256459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-08-08T13:31:57.933715Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:11:00.461167Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:0134f2e6443e9a6ad5087f6f0b41971538dd8929dd90553e1fae2f6a95584145","observation_id":"cfb4d057-5666-4f78-a646-a46b32205dc3","resolution":{"observed_at":"2026-05-10T09:38:43.165665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-08-08T13:31:57.933715Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:b20bbd4382873aca1a509c0ed6cae9187763e345893e5553ae636dbcc6d35cfe","observation_id":"d132e84b-6c28-4475-8e41-eb619ea4a887","resolution":{"observed_at":"2026-07-05T12:30:59.869841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2605.18173","last_updated":"2026-05-18T10:15:57Z","snapshot_observed_at":"2026-08-02T16:11:51.976692Z","submitted_at":"2026-05-18T10:15:57Z","title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:28:51.711892Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2605.18173"},"observation_digest":"sha256:e3b09d3cc8cff48ee394389a3a948df01f709289e5fee703d45125de96af63bb","observation_id":"ed168971-597e-4e1d-b4c1-736851e055d9","resolution":{"observed_at":"2026-05-20T11:33:14.576013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2606.30189","last_updated":"2026-06-29T12:04:01Z","snapshot_observed_at":"2026-08-08T12:01:02.445654Z","submitted_at":"2026-06-29T12:04:01Z","title":"DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:20.803078Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2606.30189"},"observation_digest":"sha256:06bebdcd4d2d1135fd927520dc3cb6e6a6f89386a46a89b77307c4d6aae0c3da","observation_id":"f45e8b3e-a9b3-4e73-9033-66b690564a28","resolution":{"observed_at":"2026-06-30T06:04:21.359361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.11985/citation-record","integrity":"/paper/2405.11985/integrity","json":"/paper/2405.11985/citation-record.json","paper":"/paper/2405.11985"},"outbound":[],"paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:26:13.109874Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2405.11985."}