{"as_of":"2026-08-17T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9958a09a82fb43494185ef0986f94e97fbd001481843aaf7ce579c18cafcef5","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:09:38.557854Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:50:22.839005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:57.560157Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"cited_work":{"arxiv_id":"2506.11820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11820","snapshot_observed_at":"2026-07-04T16:09:57.560157Z","title":"arXiv preprint arXiv:2506.11820 , year=","venue":null,"work_id":"b21ffee2-510f-40d8-a127-398231853315","year":2025},"citing_paper":{"arxiv_id":"2605.02035","last_updated":"2026-05-26T13:27:57Z","snapshot_observed_at":"2026-08-13T01:30:58.370887Z","submitted_at":"2026-05-03T19:55:06Z","title":"VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-08T19:34:02.860270Z"},"links":{"cited_paper":"/paper/2506.11820","citing_paper":"/paper/2605.02035"},"observation_digest":"sha256:cf347f861ffb4f5871d51464b7f1cbff8a404f77ae29695ce2c740c7e22a6fb9","observation_id":"959eaf23-72d1-44a7-b8c7-c507cf6f1cbe","resolution":{"observed_at":"2026-05-09T05:50:25.683678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"cited_work":{"arxiv_id":"2506.11820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11820","snapshot_observed_at":"2026-07-04T16:09:57.560157Z","title":"arXiv preprint arXiv:2506.11820 , year=","venue":null,"work_id":"b21ffee2-510f-40d8-a127-398231853315","year":2025},"citing_paper":{"arxiv_id":"2606.24333","last_updated":"2026-06-23T09:11:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:11:24Z","title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T00:50:22.839005Z"},"links":{"cited_paper":"/paper/2506.11820","citing_paper":"/paper/2606.24333"},"observation_digest":"sha256:30fdd828a61c599583ddd1b88d5f9c0876775784a267fd357c03a466db96bc34","observation_id":"29de0f1f-ec21-48f3-bb35-39b29add18b7","resolution":{"observed_at":"2026-07-04T16:09:57.561630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11820/citation-record","integrity":"/paper/2506.11820/integrity","json":"/paper/2506.11820/citation-record.json","paper":"/paper/2506.11820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.431042Z","title":null,"venue":null,"work_id":"eed9517f-6324-4b25-b4fe-08cec11e5482","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.190461Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:f9fc7c49bad6aa35d11c41b388b7456e9a68a1d37f4f3d2477c0226c0dbf2c9b","observation_id":"a07cb292-aab3-4548-b423-965549ca451a","resolution":{"observed_at":"2026-08-07T04:09:42.473118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.321180Z","title":null,"venue":null,"work_id":"9603557a-afa5-47c5-964a-0fa2f8e2a23a","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.274201Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:eccd551fb3a6d281a307aa630019f528a021fcbd6174b93c20f1a32bf172361c","observation_id":"a902591a-d0ed-43fa-82af-d9f9dacb2089","resolution":{"observed_at":"2026-08-07T04:09:42.364665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.208585Z","title":null,"venue":null,"work_id":"29e7159c-a90d-412c-9190-12aa85df6aed","year":2020},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.368938Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:97beca609c140a9fdc3671c145103330cb679763eca709e3ca3282b7f0a3ac63","observation_id":"6465ca04-a3de-47c9-8cea-a9f255bb5518","resolution":{"observed_at":"2026-08-07T04:09:42.252074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.070205Z","title":null,"venue":null,"work_id":"ac4ee13a-4733-40d9-a8ce-0f47ced35409","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.456818Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:3c3d407f65dedcf713a2051538c21fb7ebf228dba0e422a4bb9f5a04078d7182","observation_id":"7b8dc7da-69e9-4c9d-b52a-a27c1c825e7b","resolution":{"observed_at":"2026-08-07T04:09:42.147588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T04:09:34.536244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.536244Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:b4d16a8d0afe7ab4af9ac3124d908fb51b10a298d0a32067d62db012ac4e8fee","observation_id":"da00d981-6080-4a81-afd3-fd9404a8f77f","resolution":{"observed_at":"2026-08-07T04:09:34.536244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:09:34.620101Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.620101Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:073da15775f77ba561441468194c1cc3d5e9ec19fbe5d8d703fc32b9b1e2942f","observation_id":"9ce7deb8-c1b8-41d5-83cd-fa0285ca6a55","resolution":{"observed_at":"2026-08-07T04:09:34.620101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T04:09:34.693712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.693712Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:fc120840e30f481850540e9734bf5feea4b509de28c4bce57e7fedf8e296068c","observation_id":"54ad94a7-f6da-43a5-9a6e-d0fbeafe9033","resolution":{"observed_at":"2026-08-07T04:09:34.693712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.814989Z","title":null,"venue":null,"work_id":"4eb9c2c5-ea30-4005-9f35-b9cdfb6876ee","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.802169Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:cc3393838cf4ff0381a421c17827ef5a7a9354cde24bccee3fcfc4d812a15926","observation_id":"c8217aed-9829-4158-ad9c-3f61f4b3c1d8","resolution":{"observed_at":"2026-08-07T04:09:41.938815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T04:09:34.888015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.888015Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:b3ba54b873b07309060b52a434e071b97c1da7b3bf5c5ab6adac864093c9f27a","observation_id":"beae5aa9-804d-47ce-85fd-bbc5d049e92e","resolution":{"observed_at":"2026-08-07T04:09:34.888015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.596695Z","title":null,"venue":null,"work_id":"bf67ee49-5c71-4b82-aff2-df673b98784a","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.981820Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:285c1487f132ec2bbc55ea83a4f23f3e5f2788138e577a23e7da955b878a8bfc","observation_id":"a5ccf9eb-4b48-42f9-b2d2-c439bca80c13","resolution":{"observed_at":"2026-08-07T04:09:41.704019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-07T04:09:35.068668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.068668Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:e4df51429889471b643a8412a0883c2e6ac2e6adf1c2a8a52b3551d73d41dbba","observation_id":"a489ee83-af0a-4b92-92a4-dc0270172f2d","resolution":{"observed_at":"2026-08-07T04:09:35.068668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-07T04:09:35.164573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.164573Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a98ead2646d27b343c8c971d2549454919ce0ba8884ea4a82ada28af9b9f96dd","observation_id":"c3a40e3e-c8df-4cce-9e1d-0f4f7080c97f","resolution":{"observed_at":"2026-08-07T04:09:35.164573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:09:35.268346Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.268346Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:39cf6cb63a87d0d08633b41d71ffe9fa42e1dedae4db47edcd994562ea22c58f","observation_id":"5c7fcaa6-3b2c-45da-a5e6-c1a0f2802610","resolution":{"observed_at":"2026-08-07T04:09:35.268346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02333","last_updated":"2024-07-02T15:01:55Z","snapshot_observed_at":"2026-08-16T13:37:42.562578Z","submitted_at":"2024-07-02T15:01:55Z","title":"Why do LLaVA Vision-Language Models Reply to Images in English?","version":1},"cited_work":{"arxiv_id":"2407.02333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02333","snapshot_observed_at":"2026-08-07T04:09:39.159183Z","title":"Why do LLaVA Vision-Language Models Reply to Images in English?","venue":"cs.CL","work_id":"452ff4be-7186-4259-8e5e-1f6cabcd2d15","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.375611Z"},"links":{"cited_paper":"/paper/2407.02333","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:0e259b40e2ab041d18956d29122404a0edc32b7554417d1e60f673fed4610159","observation_id":"5a50f67f-5712-4359-b53e-c6e6834f46ea","resolution":{"observed_at":"2026-08-07T04:09:39.218598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.397024Z","title":null,"venue":null,"work_id":"c52bfa26-18a9-4f81-8372-41b1c934dc80","year":null},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.482280Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:057d5129873db6932fc64aae0cc36ad7a24b97c02d7ffef1f88a5c795583e9ab","observation_id":"fdb6b414-0240-4ad5-b963-8bc1245d4bea","resolution":{"observed_at":"2026-08-07T04:09:41.519045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.162030Z","title":null,"venue":null,"work_id":"b3d2ee18-aed1-4873-84b5-87e3c8b0b22a","year":null},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.712901Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:362911bc17da1f17ab3cfd1f556cb6482b4c20314eb22cd96f2feaac530fef94","observation_id":"021f66d7-dbf3-40cf-962b-d4020be13807","resolution":{"observed_at":"2026-08-07T04:09:41.265749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.930091Z","title":null,"venue":null,"work_id":"e5db079b-fdb7-4231-b46e-f5fc84c03f1a","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.896344Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:39025dff9ba8888bafd81f41f283760203602239b864eb1cf812ee3e971a0015","observation_id":"85313ac1-7066-42a3-851f-1d431dd08420","resolution":{"observed_at":"2026-08-07T04:09:41.033037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17415","last_updated":"2023-06-02T12:38:37Z","snapshot_observed_at":"2026-08-16T15:29:05.035665Z","submitted_at":"2023-05-27T08:41:18Z","title":"Exploring Better Text Image Translation with Multimodal Codebook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17415","snapshot_observed_at":"2026-08-07T04:09:35.989987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.989987Z"},"links":{"cited_paper":"/paper/2305.17415","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a6257b253bb374960c38ffbe22c505d49f604a7db8ffae3b011e37aab03f0bf7","observation_id":"9bf2ad5b-2a7a-4c85-9c6b-1ca2c814fe70","resolution":{"observed_at":"2026-08-07T04:09:35.989987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:09:36.118268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.118268Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:8405898c18d49f50dba90d9615153fc194697d9f1274b9cdcc9d697f105eaa6d","observation_id":"1d7ee12b-bb86-405d-a86f-87fd3b061468","resolution":{"observed_at":"2026-08-07T04:09:36.118268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07147","last_updated":"2024-12-16T09:28:53Z","snapshot_observed_at":"2026-08-16T18:30:54.203586Z","submitted_at":"2024-12-10T03:12:35Z","title":"MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation","version":2},"cited_work":{"arxiv_id":"2412.07147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07147","snapshot_observed_at":"2026-08-07T04:09:38.805613Z","title":"MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation","venue":"cs.CV","work_id":"219d8931-abaa-41d6-970a-c75e2229a971","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.200053Z"},"links":{"cited_paper":"/paper/2412.07147","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:f64d69ddb6cb89eb7bb8001d152e8a8821fa10e84ecc85ec75ec6e6051e23e90","observation_id":"7bc98be5-2f6d-41db-a796-33cbe7da28d4","resolution":{"observed_at":"2026-08-07T04:09:38.856996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.769488Z","title":null,"venue":null,"work_id":"a16f17bf-2052-4031-af88-0d8600586393","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.309154Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:da7a17cc59f521329d0ff3441225978fde28e26150926d3ca14d48a9a13e4777","observation_id":"c6021510-60ba-4509-a864-9b08541391ce","resolution":{"observed_at":"2026-08-07T04:09:40.859384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:36.415839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.415839Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:0f8bde96775952bcf2ffea23d76c26cd2af3a2a99cf7c396918fddce58968220","observation_id":"0557a70b-1a8b-4421-ac70-5e653519dacc","resolution":{"observed_at":"2026-08-07T04:09:36.415839Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:09:36.524679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.524679Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:121046d193a4e130f7797eaeb90636bdd8f8792c6a7d002ce5ed0a5983c2a4a6","observation_id":"a68d240e-463e-4c1a-bc8b-b2d08de45c9c","resolution":{"observed_at":"2026-08-07T04:09:36.524679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T04:09:36.610381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.610381Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a17b2b8f08c3b6ff3683ce6cf0a0546d7d6f8f10a21aaba3f7db0e213c7e0572","observation_id":"0fb004d3-12dd-46a7-a6ed-78a076c9ae56","resolution":{"observed_at":"2026-08-07T04:09:36.610381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.589451Z","title":null,"venue":null,"work_id":"ec77f289-c367-47d0-9cd9-6e416499262d","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.753882Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a6362c11dabbc73c7e4e07fa33e122987e1eba3dac308d524b39251bacd563a8","observation_id":"091fc455-d1bf-4298-bc20-200ef325884a","resolution":{"observed_at":"2026-08-07T04:09:40.660349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.411488Z","title":null,"venue":null,"work_id":"6c4bc81a-d2d8-420e-ab07-b70eafe7810e","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.828092Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:cade14a511006d3435c1d16f11ece586779a6906df135c00d17ab18af1433704","observation_id":"16f63c40-6054-47f8-8093-4e9e5391bc84","resolution":{"observed_at":"2026-08-07T04:09:40.470286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.282405Z","title":null,"venue":null,"work_id":"f972e72d-0646-47e9-9cdd-effbcbbf530e","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.958398Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:12cc93399da64d21b871740fec0115c6c8997ef15aaff7da969fc68c4143f004","observation_id":"93aa56c0-dd99-47e5-bd64-6cd2a0fa9677","resolution":{"observed_at":"2026-08-07T04:09:40.347547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.137958Z","title":null,"venue":null,"work_id":"1ceb48e8-b5a7-4afb-8b97-0136da21d94b","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.105600Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:380001f44990d3ad79e6e7a98aac0a14ea43f4fac6a0bff9f56aeb82ae7b9038","observation_id":"af145a36-0bd4-4174-8123-b1f8c71a6dd9","resolution":{"observed_at":"2026-08-07T04:09:40.184971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:09:37.234227Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.234227Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:783d4b3977844c320e4694014a3bd331a64b1a79fe7fa8039bc85c997ff462e3","observation_id":"c436a5a2-c01f-4921-a1a4-93e42c68ecb2","resolution":{"observed_at":"2026-08-07T04:09:37.234227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.969012Z","title":null,"venue":null,"work_id":"b28e7900-986a-4393-adc4-dd2536efda6f","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.356553Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a22939f2101565637c46dd5c81b756f20f07e46fa513fb652f4c001baf3ce126","observation_id":"27a7eb21-c56a-44ab-8bee-7ce0b70a4792","resolution":{"observed_at":"2026-08-07T04:09:40.038387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11432","last_updated":"2024-06-17T11:37:48Z","snapshot_observed_at":"2026-08-16T13:42:18.839684Z","submitted_at":"2024-06-17T11:37:48Z","title":"AnyTrans: Translate AnyText in the Image with Large Scale Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11432","snapshot_observed_at":"2026-08-07T04:09:37.454148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.454148Z"},"links":{"cited_paper":"/paper/2406.11432","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:8c21bd6f7466ddfe44adbec4bf67eb9a225ad3cbf3280c650eb880de02326f31","observation_id":"f6425688-e5e3-4c1d-ac57-b5a1b924ea92","resolution":{"observed_at":"2026-08-07T04:09:37.454148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.837000Z","title":null,"venue":null,"work_id":"fa204109-2434-4c06-8d25-47683f947a7b","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.579741Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:aa7aecfd95415217d99ae3a90ea99c8fc441cb32f546c2c49d5a3d6edc8338f8","observation_id":"e49542db-372d-439b-b646-7c932d159184","resolution":{"observed_at":"2026-08-07T04:09:39.890062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.686688Z","title":null,"venue":null,"work_id":"a1a6c51e-a9fd-4c59-8b02-3f6947d6e5db","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.753785Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:ec37e4518109ac5c86f96fb1310ec55921e1944630d2a01e8da22380ea8baeb7","observation_id":"352fe44c-dc6f-4756-849e-989a9caf09d1","resolution":{"observed_at":"2026-08-07T04:09:39.763487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.538557Z","title":null,"venue":null,"work_id":"f4dadc44-26d3-40fe-8851-8a88d6f46f2e","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.875638Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:9d0317dcd48013f5b72f5747e22666eb272b432c907208910e939ab0b4db7539","observation_id":"3a25f781-e255-471e-b826-4df209a5197e","resolution":{"observed_at":"2026-08-07T04:09:39.625251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.408513Z","title":null,"venue":null,"work_id":"06591893-ea43-4c82-9e7a-e2ca7f32fd9a","year":2008},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.008146Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:78e4c9170e54c81f7d9237b165d00c6da8e8ca5944ad384585036e8c73a7142e","observation_id":"8eaa5ac8-6fba-48bd-877f-4f8836538ceb","resolution":{"observed_at":"2026-08-07T04:09:39.468213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.151001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.151001Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:f7f48e92ab56044f167fe820d8c9de8de8870e390f3e06bcc2a12e5cca4b77f2","observation_id":"6c3d87d5-6e49-4bb3-b4f6-44b90f62adb2","resolution":{"observed_at":"2026-08-07T04:09:38.151001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T04:09:38.305643Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.305643Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:385173dd043b713fbdedfaec295443da1da630ebcbf9c4b775700595563c9069","observation_id":"00cb081d-4089-4d71-9413-23de75b09525","resolution":{"observed_at":"2026-08-07T04:09:38.305643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:09:38.380048Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.380048Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:fc3e3225cb598278db1a45f564fe08746d4d043945e8251a001ad5885f3971de","observation_id":"666eba29-f95c-49a0-9801-dba863f9e9b1","resolution":{"observed_at":"2026-08-07T04:09:38.380048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02210","last_updated":"2024-12-10T05:01:33Z","snapshot_observed_at":"2026-08-17T11:15:53.544014Z","submitted_at":"2024-12-03T07:03:25Z","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02210","snapshot_observed_at":"2026-08-07T04:09:38.470496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.470496Z"},"links":{"cited_paper":"/paper/2412.02210","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:8d73d4015f95c80b32ed2b1b370fdf139b7343260f9cfd278a6e2580f1c98fbf","observation_id":"c4292ea1-2568-4750-ae9c-1109fad454ab","resolution":{"observed_at":"2026-08-07T04:09:38.470496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T04:09:38.557854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.557854Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:15e91d7737ed2a0a0ae023f34a599a7d176ec6dd9695490034cccb049218c868","observation_id":"f36073cc-ae6b-47bb-a1c1-cd5d021c379b","resolution":{"observed_at":"2026-08-07T04:09:38.557854Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09095","last_updated":"2021-01-27T03:39:20Z","snapshot_observed_at":"2026-08-13T18:05:31.114488Z","submitted_at":"2020-04-20T07:19:22Z","title":"The State and Fate of Linguistic Diversity and Inclusion in the NLP World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09095","snapshot_observed_at":"2026-08-07T04:09:35.593856Z","title":"arXiv preprint arXiv:2004.09095(2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.593856Z"},"links":{"cited_paper":"/paper/2004.09095","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:776d046742f15b1f53e10c214ea49c13d8234c3e46999bccfbec3f6a1f677ee2","observation_id":"e2b7ff45-9a2c-4c19-9edb-b4fa4e9b5391","resolution":{"observed_at":"2026-08-07T04:09:35.593856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20420","last_updated":"2025-02-27T07:14:31Z","snapshot_observed_at":"2026-08-16T12:54:45.174631Z","submitted_at":"2025-02-27T07:14:31Z","title":"Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation","version":1},"cited_work":{"arxiv_id":"2502.20420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20420","snapshot_observed_at":"2026-08-07T04:09:38.985231Z","title":"Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation","venue":"cs.CL","work_id":"738c18cd-e8e5-4401-ab34-4d7011f26d61","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.787476Z"},"links":{"cited_paper":"/paper/2502.20420","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:93334ab78f817085ec93134c32230283e08641e37e0abc5911675190344a701f","observation_id":"5b8334f9-b787-4344-8067-57e8e8af5110","resolution":{"observed_at":"2026-08-07T04:09:39.064229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:41:24.518662Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2506.11820."}