{"as_of":"2026-08-18T18:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f02bd67e597a2836464844754f7cbf2cd412eb174f1c9900aef16442a69243bb","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:34:18.276729Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:03:14.145551Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:29:07.343009Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-08-16T01:03:14.145551Z","title":"Vall-e x: Zero-shot cross-lingual speech synthesis with discrete codes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04639","last_updated":"2025-05-04T23:23:46Z","snapshot_observed_at":"2026-08-18T11:18:39.056507Z","submitted_at":"2025-05-04T23:23:46Z","title":"Language translation, and change of accent for speech-to-speech task using diffusion model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:03:14.145551Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2505.04639"},"observation_digest":"sha256:c8d93153df1563937879438852eb454bf492cb5a49b5786a39beaba97dd0adbe","observation_id":"35f5641d-617a-4b4e-948a-08ffdeb0b915","resolution":{"observed_at":"2026-08-16T01:03:14.145551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":"2411.14453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-08-07T11:29:07.343009Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","venue":"cs.CL","work_id":"ad1960c3-d599-43e3-868b-b6467aae0bf7","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-13T12:54:08.987275Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.617509Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:cb461215d14a3312fa96d0b755e9e988650c3d0c3e66a409571ca8f828bbffcb","observation_id":"666aa822-1a2a-4348-bae2-6e5fe90247a1","resolution":{"observed_at":"2026-08-07T11:29:07.434642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-08-15T18:22:38.332652Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18263","last_updated":"2025-07-24T10:07:59Z","snapshot_observed_at":"2026-08-18T11:19:53.062923Z","submitted_at":"2025-07-24T10:07:59Z","title":"Locate-and-Focus: Enhancing Terminology Translation in Speech Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T18:22:38.332652Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2507.18263"},"observation_digest":"sha256:a9bdf9d0f4525d9ec48cb3a2c31109916880b18b5e9c204d3a1c0882c561cef2","observation_id":"57fdf081-cad7-47c9-9518-c8400ed7dea4","resolution":{"observed_at":"2026-08-15T18:22:38.332652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Direct speech-to-speech neural machine translation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3bcdee6c0c6dc6a9e6b9342c2ec9a60a8c93970e7ffd73ba3aaf2f78a4387c78","observation_id":"cc0aed22-173e-4283-a805-bdd0a25edd93","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14453/citation-record","integrity":"/paper/2411.14453/integrity","json":"/paper/2411.14453/citation-record.json","paper":"/paper/2411.14453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.07455","last_updated":"2023-05-12T13:07:51Z","snapshot_observed_at":"2026-08-18T11:19:57.974261Z","submitted_at":"2023-05-12T13:07:51Z","title":"Improving Cascaded Unsupervised Speech Translation with Denoising Back-translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07455","snapshot_observed_at":"2026-08-12T21:34:18.230150Z","title":"In The Twelfth Interna- tional Conference on Learning Representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.230150Z"},"links":{"cited_paper":"/paper/2305.07455","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:d049185be8e537998a207ff9fe6ec9810d6642f2d8f0ff482bc32ff04523ab05","observation_id":"21de4f23-a26d-4a4c-a551-1b9db7f8369c","resolution":{"observed_at":"2026-08-12T21:34:18.230150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08655","last_updated":"2023-07-17T17:12:44Z","snapshot_observed_at":"2026-08-16T15:15:37.010866Z","submitted_at":"2023-07-17T17:12:44Z","title":"Multilingual Speech-to-Speech Translation into Multiple Target Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08655","snapshot_observed_at":"2026-08-12T21:34:18.235088Z","title":"arXiv preprint arXiv:2307.08655","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.235088Z"},"links":{"cited_paper":"/paper/2307.08655","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:a28a53d2fa605ac0bed9f6175836f79d93e2c980f4c4816555115e0ef5db8da0","observation_id":"1c748b52-a5ca-438a-8946-797825713263","resolution":{"observed_at":"2026-08-12T21:34:18.235088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:34:18.539043Z","title":"In Proceed- ings of the 58th Annual Meeting of the As- sociation for Computational Linguistics , pages 7871–7880, Online","venue":null,"work_id":"dd73c8e1-9f5d-4465-bcfd-600cb1831659","year":2021},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.260179Z"},"links":{"citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:61468c87dea939cba93d6f3aaef09ee000a65f9c8fdd1c1aa02509c052efd494","observation_id":"6702d8cf-0297-45fc-a6f8-091f42d1469a","resolution":{"observed_at":"2026-08-12T21:34:18.544854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08250","last_updated":"2022-01-12T22:30:25Z","snapshot_observed_at":"2026-08-18T11:19:53.962691Z","submitted_at":"2021-10-15T17:59:15Z","title":"Direct Simultaneous Speech-to-Speech Translation with Variational Monotonic Multihead Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08250","snapshot_observed_at":"2026-08-12T21:34:18.265289Z","title":"In 2023 IEEE International Conference on Acous- tics, Speech and Signal Processing (ICASSP) , pages 1–5, Rhodes Island, Greece","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.265289Z"},"links":{"cited_paper":"/paper/2110.08250","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:c5e115cf74e0eb334857a1813ae0d65e52f29dd4b2cde4b69ba16165bfb965ac","observation_id":"f295203a-b46c-4835-a982-f57c23ebb729","resolution":{"observed_at":"2026-08-12T21:34:18.265289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11194","last_updated":"2022-08-23T21:07:42Z","snapshot_observed_at":"2026-08-18T11:20:10.457468Z","submitted_at":"2022-08-23T21:07:42Z","title":"Bitext Mining for Low-Resource Languages via Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2208.11194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.11194","snapshot_observed_at":"2026-08-12T21:34:18.334174Z","title":"Bitext Mining for Low-Resource Languages via Contrastive Learning","venue":"cs.CL","work_id":"e6f0a39f-41e6-4fc8-b216-a78b294c2831","year":2022},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.271333Z"},"links":{"cited_paper":"/paper/2208.11194","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:0bd2b6cbeda58baf9039c3209e0aa5cb4e2d6ac2216f7f8e131c988276d7148f","observation_id":"e2ce0484-036e-4ccf-8433-80862d6e150a","resolution":{"observed_at":"2026-08-12T21:34:18.341594Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-18T11:27:13.551680Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-12T21:34:18.276729Z","title":"Direct\" provide details about the direct models, while the columns under","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.276729Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:3318521f99f19b277e46403760a6b24b88782adbebfefb6b2ad4bfb455725c5c","observation_id":"18ceeae0-dc3c-4e5b-892b-a9ba7381eadc","resolution":{"observed_at":"2026-08-12T21:34:18.276729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15967","last_updated":"2024-02-25T03:03:34Z","snapshot_observed_at":"2026-08-18T11:19:58.494147Z","submitted_at":"2024-02-25T03:03:34Z","title":"Direct Punjabi to English speech translation using discrete units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15967","snapshot_observed_at":"2026-08-12T21:34:18.245073Z","title":"Hirofumi Inaguma, Sravya Popuri, Ilia Ku- likov, Peng-Jen Chen, Changhan Wang, Yu-An Chung, Yun Tang, Ann Lee, Shinji Watanabe, and Juan Pino","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":1881,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.245073Z"},"links":{"cited_paper":"/paper/2402.15967","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:f4a4fb6174c13076fc8c401a864e82583c352dc78aa8ef8aae836071071f969d","observation_id":"305100fb-9ce7-44e0-9ee1-e0060646091c","resolution":{"observed_at":"2026-08-12T21:34:18.245073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.02012","last_updated":"2016-06-07T03:38:46Z","snapshot_observed_at":"2026-08-14T21:53:54.797654Z","submitted_at":"2016-06-07T03:38:46Z","title":"Can neural machine translation do simultaneous translation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.02012","snapshot_observed_at":"2026-08-12T21:34:18.219640Z","title":"Alexandre Bérard, Laurent Besacier, Ali Can Ko- cabiyikoglu, and Olivier Pietquin","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":1901,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.219640Z"},"links":{"cited_paper":"/paper/1606.02012","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:c9b95fa24728ed0fed326bba9084ba64673d1718596828b37e0df515c4a56ab5","observation_id":"e5520895-a9ca-4d46-b7ea-2de2dac134d9","resolution":{"observed_at":"2026-08-12T21:34:18.219640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17809","last_updated":"2024-10-31T03:11:16Z","snapshot_observed_at":"2026-08-16T13:48:47.760621Z","submitted_at":"2024-05-28T04:11:37Z","title":"TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation","version":3},"cited_work":{"arxiv_id":"2405.17809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17809","snapshot_observed_at":"2026-08-12T21:34:18.377577Z","title":"TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation","venue":"cs.CL","work_id":"5bc49df2-cdf0-48e1-a23e-8f6a445f534e","year":2024},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.255046Z"},"links":{"cited_paper":"/paper/2405.17809","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:e85240c3b4751c2f288480f54cb2d81ad7c09c1a46224968e28623cdab22ddb7","observation_id":"bb01d36f-3bd7-4561-971f-08adacf90cda","resolution":{"observed_at":"2026-08-12T21:34:18.383223Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T21:34:18.240067Z","title":"arXiv preprint arXiv:1503.02531","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.240067Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:dfa0f950221986b6d7b9d8d381e5d1c8a1318de4ac42fe87d9761ae4551e15bb","observation_id":"3f2d5e3e-36a8-46b7-9d7d-9c07f7fbf970","resolution":{"observed_at":"2026-08-12T21:34:18.240067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:34:18.556118Z","title":"34th Conference on Neural Information Processing Systems (NeurIPS 2020)","venue":null,"work_id":"fab4668d-5e99-4062-9609-6bd42880b53a","year":2020},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.250181Z"},"links":{"citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:32aadc2ea211575d22cff0bd98472332d10576c001a1d3e7c6f9e4d9fe4d5ad9","observation_id":"7cd98132-8063-4ddd-8bd7-2107e2957b56","resolution":{"observed_at":"2026-08-12T21:34:18.561815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15405","last_updated":"2024-11-06T21:18:59Z","snapshot_observed_at":"2026-08-16T15:30:01.930654Z","submitted_at":"2023-05-24T17:59:05Z","title":"Textless Speech-to-Speech Translation With Limited Parallel Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15405","snapshot_observed_at":"2026-08-12T21:34:18.225174Z","title":"In 2022 IEEE Spoken Language Technology Workshop, SLT 2022 - Proceedings, pages 798–805","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.225174Z"},"links":{"cited_paper":"/paper/2305.15405","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:12f6963408a55b9f8fd2861f087ce11c4139eb7463b82d3ffaa922055869b2d5","observation_id":"64d0639f-af37-4353-b2b1-508ed6784e5f","resolution":{"observed_at":"2026-08-12T21:34:18.225174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04691","last_updated":"2024-07-04T07:05:48Z","snapshot_observed_at":"2026-08-16T14:36:40.989793Z","submitted_at":"2023-12-07T20:42:05Z","title":"Simul-LLM: A Framework for Exploring High-Quality Simultaneous Translation with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04691","snapshot_observed_at":"2026-08-12T21:34:18.206733Z","title":"arXiv preprint arXiv:2312.04691, abs/2312.04691","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.206733Z"},"links":{"cited_paper":"/paper/2312.04691","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:1d81a1c0edc85445ad6f7d5d8cc5a276687c1098a7c49b1c7cf9bbe9e5e47f0f","observation_id":"df6c2e1f-127a-4991-a5cf-300d16c78cb1","resolution":{"observed_at":"2026-08-12T21:34:18.206733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02133","last_updated":"2024-06-04T09:21:31Z","snapshot_observed_at":"2026-08-16T13:46:22.279088Z","submitted_at":"2024-06-04T09:21:31Z","title":"SimulTron: On-Device Simultaneous Speech to Speech Translation","version":1},"cited_work":{"arxiv_id":"2406.02133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02133","snapshot_observed_at":"2026-08-12T21:34:18.502997Z","title":"SimulTron: On-Device Simultaneous Speech to Speech Translation","venue":"eess.AS","work_id":"b694d7ac-cc29-4cc9-ac82-1cd586090696","year":2024},"citing_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T21:34:18.212757Z"},"links":{"cited_paper":"/paper/2406.02133","citing_paper":"/paper/2411.14453"},"observation_digest":"sha256:0c36c6c9ac46fada031eb6d1a60c73dffd9bbf32bc7bce08e7055dee35f9fdd8","observation_id":"990404a8-9531-42ff-a407-42b2984d66f3","resolution":{"observed_at":"2026-08-12T21:34:18.509271Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T11:19:41.338890Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 4 inbound Pith citation observations for arXiv:2411.14453."}