{"as_of":"2026-08-21T12:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ceeff07f3fe1b59becb569193b960d854f3affe3936dc00ccc9ca4e1845dda12","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:48:51.453332Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T19:34:02.860270Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T05:50:25.837175Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.07306 , year=","venue":null,"work_id":"0cbab4ae-25aa-4981-b68a-5c316ceef30f","year":null},"citing_paper":{"arxiv_id":"2605.02035","last_updated":"2026-05-26T13:27:57Z","snapshot_observed_at":"2026-08-13T01:30:58.370887Z","submitted_at":"2026-05-03T19:55:06Z","title":"VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-08T19:34:02.860270Z"},"links":{"cited_paper":"/paper/2507.07306","citing_paper":"/paper/2605.02035"},"observation_digest":"sha256:3f8db7cadf2a184c78445a9cfd7ee5d57c20ccd010baa15bb8dbc61230b77f99","observation_id":"59257bbb-5a73-44df-9dbc-4678817bf33b","resolution":{"observed_at":"2026-05-09T05:50:25.838847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07306/citation-record","integrity":"/paper/2507.07306/integrity","json":"/paper/2507.07306/citation-record.json","paper":"/paper/2507.07306"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.419364Z","title":"0:00:01,229","venue":null,"work_id":"01f36c8e-a7ea-434a-a3e6-363f29656cfd","year":null},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:51.266705Z"},"links":{"citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:095d2d769da220c41b81eb1f2c63f458c47c54b85a7be86ee49c0cd50413f6b8","observation_id":"a9bd8f55-93ce-4bbc-87d3-99ed0d237ec9","resolution":{"observed_at":"2026-08-06T18:48:52.564849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.192003Z","title":"- Translate into natural, fluent Simplified Chinese","venue":null,"work_id":"c11f6859-5364-4633-91d9-b889f7a63de9","year":null},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:51.354932Z"},"links":{"citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:a8e485a1545456b5209582024dda8a396948ef7283f337978fd2fa6dadd9e164","observation_id":"fbc4129c-cc86-4fa1-8c96-27f2c8d7ac72","resolution":{"observed_at":"2026-08-06T18:48:52.301134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T18:48:50.400665Z","title":"Simone Conia, Daniel Lee, Min Li, Umar Farooq Min- has, Saloni Potdar, and Yunyao Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.400665Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:f858e5e95db36016d053055d2ccee55830802d099762710899c77c2c1921aee2","observation_id":"49dbd9a3-455b-4399-bfc5-c3124132ee7f","resolution":{"observed_at":"2026-08-06T18:48:50.400665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08206","last_updated":"2024-01-16T08:44:29Z","snapshot_observed_at":"2026-08-17T16:31:42.634697Z","submitted_at":"2024-01-16T08:44:29Z","title":"Generative Multi-Modal Knowledge Retrieval with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08206","snapshot_observed_at":"2026-08-06T18:48:50.667682Z","title":"InProceedings of the 28th ACM International Conference on Multime- dia, MM ’20","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.667682Z"},"links":{"cited_paper":"/paper/2401.08206","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:fb415b0721868c1ce843a5f664f52f4361c21416df646badbaa59d1b88d00623","observation_id":"eade5100-c891-44b2-bbc9-5497669b11b7","resolution":{"observed_at":"2026-08-06T18:48:50.667682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04809","last_updated":"2024-04-07T05:04:38Z","snapshot_observed_at":"2026-08-16T14:03:03.282062Z","submitted_at":"2024-04-07T05:04:38Z","title":"Low-Resource Machine Translation through Retrieval-Augmented LLM Prompting: A Study on the Mambai Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04809","snapshot_observed_at":"2026-08-06T18:48:50.814311Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.814311Z"},"links":{"cited_paper":"/paper/2404.04809","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:049fa65921c02987674673406f18e4a906e950b88ae1e7d5ad45376e82c27e23","observation_id":"40b6a302-24ba-4964-af30-91310563ccd1","resolution":{"observed_at":"2026-08-06T18:48:50.814311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12669","last_updated":"2024-05-23T03:56:56Z","snapshot_observed_at":"2026-08-16T13:51:01.596518Z","submitted_at":"2024-05-21T10:34:47Z","title":"A Survey on Multi-modal Machine Translation: Tasks, Methods and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12669","snapshot_observed_at":"2026-08-06T18:48:51.081327Z","title":"InProceedings of ACL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:51.081327Z"},"links":{"cited_paper":"/paper/2405.12669","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:6e6f4f5644c653ddcb2b487abf015ba0ee0f99e3bcd2a95d1479c762e3ed0be0","observation_id":"507589dc-73e6-4233-8273-186ec0158572","resolution":{"observed_at":"2026-08-06T18:48:51.081327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:52.015384Z","title":"翻译提供的视频中的说话内容到中文。只需要输出翻译内容原文，不要输出任何解释。","venue":null,"work_id":"85bdc0f2-d35e-4ca2-839c-863b70a9b032","year":null},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:51.453332Z"},"links":{"citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:f51f3ec2f46ad2ddf65fbd5abcda7091d84f24d40c10d03a75dd87c67ca8d4a3","observation_id":"756f39ab-2379-4120-8206-c9aba4205673","resolution":{"observed_at":"2026-08-06T18:48:52.090711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-06T18:48:51.181622Z","title":"pilum\" in the source text seems to be a mistake or unclear. It might be intended to refer to","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:51.181622Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:d797e0cbb2063275656d9ffc796a72845329f8e9c68678a7ebf6b399dd3dace1","observation_id":"6c36e146-7be7-4520-bc03-e7fef0e2f1da","resolution":{"observed_at":"2026-08-06T18:48:51.181622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02182","last_updated":"2023-04-21T09:35:44Z","snapshot_observed_at":"2026-08-16T15:42:40.958386Z","submitted_at":"2023-04-05T01:17:59Z","title":"How to Design Translation Prompts for ChatGPT: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02182","snapshot_observed_at":"2026-08-06T18:48:50.559294Z","title":"InProceedings of the 2020 Conference on Empirical Methods in Natural Language Process- ing (EMNLP), pages 61–71, Online","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.559294Z"},"links":{"cited_paper":"/paper/2304.02182","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:7bd2faca3e9b6761a9ff6445f66dc12245dcb7469556b9185f46f968cb558d3f","observation_id":"60b8b508-fee2-4c63-a1d5-756ac76760a8","resolution":{"observed_at":"2026-08-06T18:48:50.559294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:48:50.931379Z","title":"Thibault Sellam, Dipanjan Das, and Ankur P Parikh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.931379Z"},"links":{"citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:160f23ab742b213eda34bd8e9c121dda87ac97fa43b53b2d0d03e64fa0bd84bf","observation_id":"a052cd3b-a9f7-4471-9a7d-561997f55ad8","resolution":{"observed_at":"2026-08-06T18:48:50.931379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02835","last_updated":"2024-04-03T16:13:29Z","snapshot_observed_at":"2026-08-16T14:03:54.074491Z","submitted_at":"2024-04-03T16:13:29Z","title":"Retrieving Examples from Memory for Retrieval Augmented Neural Machine Translation: A Systematic Comparison","version":1},"cited_work":{"arxiv_id":"2404.02835","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02835","snapshot_observed_at":"2026-08-06T18:48:51.743604Z","title":"Retrieving Examples from Memory for Retrieval Augmented Neural Machine Translation: A Systematic Comparison","venue":"cs.CL","work_id":"16e81fee-b6c9-47fa-8069-4c1ff53e91de","year":2024},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.286314Z"},"links":{"cited_paper":"/paper/2404.02835","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:d2861e3818da022360490eb18c3f971e34dc36c192804008c5db07c0914c2443","observation_id":"29858307-8c49-4cdb-a116-dd6566757533","resolution":{"observed_at":"2026-08-06T18:48:51.849051Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T18:48:50.189858Z","title":"Maxime Bouthors, Josep Crego, and Francois Yvon","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:50.189858Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.07306"},"observation_digest":"sha256:32c8261b4afc62754f159d33e36c91f9377b8f87ba90517b3b6faaa6e99bae37","observation_id":"5bd26649-41f8-44b1-a26e-b69870a8c3f1","resolution":{"observed_at":"2026-08-06T18:48:50.189858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07306","last_updated":"2025-07-09T22:05:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-21T10:56:09.832405Z","submitted_at":"2025-07-09T22:05:46Z","title":"ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2507.07306."}