{"as_of":"2026-08-09T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ff90082700d797be8c785b6a0833937cfa7cbedb5d6bf87c0a9a49f6dc56e84","coverage":[{"denominator":165,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:54.976320Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T09:46:15.701501Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:39:46.872455Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"cited_work":{"arxiv_id":"2506.02443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02443","snapshot_observed_at":"2026-07-04T09:39:46.872455Z","title":null,"venue":null,"work_id":"34063876-18bb-45fd-8555-6a095beb296a","year":2025},"citing_paper":{"arxiv_id":"2605.18779","last_updated":"2026-04-28T15:57:54Z","snapshot_observed_at":"2026-08-09T01:40:33.193299Z","submitted_at":"2026-04-28T15:57:54Z","title":"Achieving Generational Peace in Mali through Intergenerational Mean-Field-Type Game-based Incentives","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T00:58:13.403170Z"},"links":{"cited_paper":"/paper/2506.02443","citing_paper":"/paper/2605.18779"},"observation_digest":"sha256:50b1a8584cd6faf4dd6b2a728c6eeee218d484a47140f9f849f0193a810045d7","observation_id":"b97f05c3-f9ac-40d9-8c1e-c8c2a4cb0a72","resolution":{"observed_at":"2026-05-21T00:59:19.261302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"cited_work":{"arxiv_id":"2506.02443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02443","snapshot_observed_at":"2026-07-04T09:39:46.872455Z","title":null,"venue":null,"work_id":"34063876-18bb-45fd-8555-6a095beb296a","year":2025},"citing_paper":{"arxiv_id":"2606.22512","last_updated":"2026-06-21T14:05:55Z","snapshot_observed_at":"2026-08-09T05:40:15.157101Z","submitted_at":"2026-06-21T14:05:55Z","title":"Mitigating Polycentric Conflict-Trap Risk in Mali via Intergenerational Volterra Mean-Field-Type Games","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T09:46:15.701501Z"},"links":{"cited_paper":"/paper/2506.02443","citing_paper":"/paper/2606.22512"},"observation_digest":"sha256:bcc8da544b4ae56ad265f50719e11866f9cea49982d497bc04333443374e297e","observation_id":"e83bdcdb-5e9f-4667-9220-e8c24470eaa5","resolution":{"observed_at":"2026-07-04T09:39:46.381030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"cited_work":{"arxiv_id":"2506.02443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02443","snapshot_observed_at":"2026-07-04T09:39:46.872455Z","title":null,"venue":null,"work_id":"34063876-18bb-45fd-8555-6a095beb296a","year":2025},"citing_paper":{"arxiv_id":"2606.22524","last_updated":"2026-06-23T09:11:48Z","snapshot_observed_at":"2026-08-03T01:09:41.797918Z","submitted_at":"2026-06-21T14:22:06Z","title":"Risk-Aware Information Theory","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T09:41:41.049881Z"},"links":{"cited_paper":"/paper/2506.02443","citing_paper":"/paper/2606.22524"},"observation_digest":"sha256:3eaaecaae93947ba4749c0880409ef5c42a267a3dbf042b8a01af145337fd53d","observation_id":"f7b6c78e-a369-4e67-867a-2a4f67fa9319","resolution":{"observed_at":"2026-07-04T09:39:46.873728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02443/citation-record","integrity":"/paper/2506.02443/integrity","json":"/paper/2506.02443/citation-record.json","paper":"/paper/2506.02443"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:45.767223Z","title":"Simultron: On-device simultaneous speech to speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:45.767223Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:6ec5602cfbb1f386884431cee528f2682e273c30177a19031ddfc51bdfe379fd","observation_id":"c6c2304a-23ac-4914-ba28-4f55fc9e71c3","resolution":{"observed_at":"2026-08-07T11:28:45.767223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:45.821059Z","title":"Qwen 2.5: A comprehensive review of the leading resource-efficient llm with potentioal to surpass all competitors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:45.821059Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:0e5c53f317e8e95bd21a1cf8b72f8f09be23e96e2822946ad7d985c9ee4e695a","observation_id":"873835c3-1a3e-4f91-b08d-eda15d57db18","resolution":{"observed_at":"2026-08-07T11:28:45.821059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:45.924856Z","title":"Analysis of layer- wise training in direct speech to speech translation using bi-lstm","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:45.924856Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:5d38a633d4446e9f6dc28855d727125c85105bf4ce14f20918380e3a30176c7c","observation_id":"32a0ea4b-8888-4f91-83a8-5d35e1858e85","resolution":{"observed_at":"2026-08-07T11:28:45.924856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.038879Z","title":"Precipitation nowcasting with generative diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.038879Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4c0c7fd096e1b2d2061b8b6b06fae55d1ae08fb3fe7e82577c7ef0caec2cb085","observation_id":"2a273406-4bde-489e-bdd9-71d54fcd955a","resolution":{"observed_at":"2026-08-07T11:28:46.038879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.191304Z","title":"Mean-Field-Type Game Theory: Applica- tions, volume 2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.191304Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:639924bb2700b14a8212a2c1dd32d36b0f26563d0c3fe1ae2a29160911a73425","observation_id":"3b8fe074-38c4-4a16-aaab-be8e14324918","resolution":{"observed_at":"2026-08-07T11:28:46.191304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.297443Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.297443Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a37301d171eb868895babc0d7b3b411a8c5484ffea878a3490cd153fc4efc132","observation_id":"50a12541-1011-418a-890b-61774aaf52b1","resolution":{"observed_at":"2026-08-07T11:28:46.297443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01744","last_updated":"2016-12-06T10:48:56Z","snapshot_observed_at":"2026-08-08T03:00:23.406003Z","submitted_at":"2016-12-06T10:48:56Z","title":"Listen and Translate: A Proof of Concept for End-to-End Speech-to-Text Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01744","snapshot_observed_at":"2026-08-07T11:28:46.397405Z","title":"Listen and translate: A proof of concept for end-to-end speech-to-text translation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.397405Z"},"links":{"cited_paper":"/paper/1612.01744","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:286c13e3e10e80a4e5bffc544c7d89df52241675e51c22deaa57cabead068417","observation_id":"f7990542-4be9-4a87-90b4-55da5b2b7ea4","resolution":{"observed_at":"2026-08-07T11:28:46.397405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.487794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.487794Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:88428f670b4862679c924917c98cb144963c690e260a60770002b1a377c8adde","observation_id":"1c201fa9-12a9-4fbd-933a-bcdce127e9ac","resolution":{"observed_at":"2026-08-07T11:28:46.487794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.586257Z","title":"Large language models are strong audio-visual speech recognition learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.586257Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:78ceac7c2fd3e114c1e04515e418b7ae265f48892678f169d3d817bd7073d963","observation_id":"c72b7324-91de-4b01-9e1e-f8fae1dd1ebd","resolution":{"observed_at":"2026-08-07T11:28:46.586257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.705659Z","title":"Low frame-rate speech codec: a codec designed for fast high-quality speech llm training and inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.705659Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:669a3a4b3bc989f14732ca0086b44926583ec8f278d329f3de70ddf1ca80cef0","observation_id":"82501d3c-2e97-4271-9597-0295d15f6637","resolution":{"observed_at":"2026-08-07T11:28:46.705659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.827097Z","title":"A speech-to-speech translation based interface for tourism","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.827097Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b5e904ef0e7c54387123893ff58e1e6446a4434677159fdaa60b1e929ec98884","observation_id":"8355f08a-cb85-47f3-8dae-a183f17c899a","resolution":{"observed_at":"2026-08-07T11:28:46.827097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.942799Z","title":"Exploring in-context learning of textless speech language model for speech classification tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.942799Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:743531d365a2afef13a21add19d65a8826647e5019c48529a7cb50fbe8d2111a","observation_id":"257d59fa-52f2-480f-942e-00eab9818c01","resolution":{"observed_at":"2026-08-07T11:28:46.942799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-07-06T20:27:32.742145Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17202","snapshot_observed_at":"2026-08-07T11:28:47.037457Z","title":"Audio large language models can be descriptive speech quality evaluators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.037457Z"},"links":{"cited_paper":"/paper/2501.17202","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7b1124945812406d835d1266c70be1b3a408c193392bac3aff8dc138e5b61aca","observation_id":"ffd1783b-d96b-45b3-875b-cd32e9e3f7cc","resolution":{"observed_at":"2026-08-07T11:28:47.037457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:47.131408Z","title":"Multi-modal generative ai: Multi-modal llm, diffusion and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.131408Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:8d484f240f33aa2b58a2c5ac8d9deb660c0ada9d7bf6de69817c24f595607e73","observation_id":"50a4e804-f797-4395-8160-ed86c96a8184","resolution":{"observed_at":"2026-08-07T11:28:47.131408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08486","last_updated":"2022-12-16T14:00:26Z","snapshot_observed_at":"2026-08-04T00:47:45.521029Z","submitted_at":"2022-12-16T14:00:26Z","title":"BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric","version":1},"cited_work":{"arxiv_id":"2212.08486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.08486","snapshot_observed_at":"2026-08-07T11:29:09.112333Z","title":"BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric","venue":"cs.CL","work_id":"3ad6c2d1-82f4-460e-9a37-8782c243736f","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.272554Z"},"links":{"cited_paper":"/paper/2212.08486","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:90e344c48090c9d6009ceb5039406a38b434f3d66864d297f50a80e5d8b0033d","observation_id":"cfb96779-2c01-4c02-8f85-b926d2500d09","resolution":{"observed_at":"2026-08-07T11:29:09.300688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:47.395714Z","title":"Opportunities and challenges of diffusion models for generative ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.395714Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:dc1aca38fea0c1093d45f91635010eacc747d5c12031865f65b06f70cc09199f","observation_id":"e0a91960-f798-408d-9327-e419336192c6","resolution":{"observed_at":"2026-08-07T11:28:47.395714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06474","last_updated":"2022-11-11T20:21:38Z","snapshot_observed_at":"2026-08-03T02:00:26.609861Z","submitted_at":"2022-11-11T20:21:38Z","title":"Speech-to-Speech Translation For A Real-world Unwritten Language","version":1},"cited_work":{"arxiv_id":"2211.06474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.06474","snapshot_observed_at":"2026-08-07T11:29:08.840773Z","title":"Speech-to-Speech Translation For A Real-world Unwritten Language","venue":"cs.CL","work_id":"e75b5cf0-7e17-4dd4-a676-85d2f70468dd","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.506438Z"},"links":{"cited_paper":"/paper/2211.06474","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:0f3030131fff15c0616f98c034c1e0f9ca9d759067dd566af5d023545c1ec2bb","observation_id":"d123d686-eb6c-44ea-b2e1-1c3d8cda3ec5","resolution":{"observed_at":"2026-08-07T11:29:08.984427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18680","last_updated":"2024-11-06T10:27:05Z","snapshot_observed_at":"2026-08-03T23:01:12.075714Z","submitted_at":"2024-09-27T12:06:53Z","title":"Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18680","snapshot_observed_at":"2026-08-07T11:28:47.620955Z","title":"Beyond single-audio: Advancing multi-audio processing in audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.620955Z"},"links":{"cited_paper":"/paper/2409.18680","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:be8155eb78c358cac40d5c8a232cc117f0bb14eed2709f2234e2bffc4937f508","observation_id":"45848d7e-2c1f-42fb-ad7b-5181aebd560e","resolution":{"observed_at":"2026-08-07T11:28:47.620955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11026","last_updated":"2025-07-30T05:08:14Z","snapshot_observed_at":"2026-08-07T17:05:12.555600Z","submitted_at":"2025-03-14T02:48:43Z","title":"MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation","version":2},"cited_work":{"arxiv_id":"2503.11026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11026","snapshot_observed_at":"2026-08-07T11:29:08.556163Z","title":"MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation","venue":"eess.AS","work_id":"371d0a29-aec7-4185-8710-ff75e87e053f","year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.738849Z"},"links":{"cited_paper":"/paper/2503.11026","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:3e4a9c4d0c58124fb60733cab747b6a9c6b9639e00f9b0f4372955461aa1b41e","observation_id":"f85aa4a1-dd53-4ecd-855f-9464586307fb","resolution":{"observed_at":"2026-08-07T11:29:08.710391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:47.864422Z","title":"V2sflow: Video-to-speech generation with speech decomposition and rectified flow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.864422Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7ea8eb34e78bc84fb33b13f8aeb1b4bdce4ab239150a3d7a0716a3b5b2d26bbe","observation_id":"4cd6b87b-9d0a-4756-914e-c97a4f230078","resolution":{"observed_at":"2026-08-07T11:28:47.864422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:28:47.996341Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.996341Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2adc6e300602c86374743b4f0d160cfa0af2faec94f44acfdedc9bbd663b4d93","observation_id":"ed150bb4-fd36-4975-ba85-8a9f662e12e9","resolution":{"observed_at":"2026-08-07T11:28:47.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T11:28:48.113094Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.113094Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7436562ae63e21afa31878de98e2dcad1cd387a6f15022a1ae98595029e6973c","observation_id":"70e5c870-ac9f-41f7-bfa6-0dd9bddde940","resolution":{"observed_at":"2026-08-07T11:28:48.113094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:48.258509Z","title":"Diffusion models in vision: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.258509Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7f54f0788e594c1c5d1b469818009dd104442d417fda25a9f8aaabc0e7566e03","observation_id":"b4b26d0b-0a3d-4474-ab62-54688b122d44","resolution":{"observed_at":"2026-08-07T11:28:48.258509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05547","last_updated":"2024-06-08T18:34:28Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:34:28Z","title":"Exploring the Benefits of Tokenization of Discrete Acoustic Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05547","snapshot_observed_at":"2026-08-07T11:28:48.396469Z","title":"Exploring the benefits of tokenization of discrete acoustic units","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.396469Z"},"links":{"cited_paper":"/paper/2406.05547","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:145f4ca293791f1b86a941ebc0a700ea831f8501ba63f282341b50ab79ef47a7","observation_id":"499a2de5-a6d6-49b1-9bbe-b68e66bb5ecb","resolution":{"observed_at":"2026-08-07T11:28:48.396469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04476","snapshot_observed_at":"2026-08-07T11:28:48.510861Z","title":"Adiff: Explaining audio difference using natural language","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.510861Z"},"links":{"cited_paper":"/paper/2502.04476","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c90e28b7262ce3dfd75a059750c5061326dce9ecd277326d46cc2da1d6e1d583","observation_id":"aceb2984-3db4-4261-9616-02507bf01c93","resolution":{"observed_at":"2026-08-07T11:28:48.510861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:48.632625Z","title":"French- fulfulde textless and cascading speech translation: Towards a dual architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.632625Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:bc892dba6ba361accf29607776a996748283d8f21b2b92c5b551c465a6a4fd46","observation_id":"ab55b59d-fcab-4bd1-88ca-d70844f0a013","resolution":{"observed_at":"2026-08-07T11:28:48.632625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15405","last_updated":"2024-11-06T21:18:59Z","snapshot_observed_at":"2026-07-06T15:32:49.322000Z","submitted_at":"2023-05-24T17:59:05Z","title":"Textless Speech-to-Speech Translation With Limited Parallel Data","version":3},"cited_work":{"arxiv_id":"2305.15405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15405","snapshot_observed_at":"2026-08-07T11:29:08.257674Z","title":"Textless Speech-to-Speech Translation With Limited Parallel Data","venue":"cs.CL","work_id":"115120e0-0fff-4143-857a-d09a5bfd3d3b","year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.766848Z"},"links":{"cited_paper":"/paper/2305.15405","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:db317aff1f0a31dae9d332456efd30bcc3de91a7e4db81457de351b62691533d","observation_id":"d1013065-7116-412b-8efe-45c6e9a37755","resolution":{"observed_at":"2026-08-07T11:29:08.377385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02982","last_updated":"2023-06-13T15:15:17Z","snapshot_observed_at":"2026-07-06T15:38:43.389873Z","submitted_at":"2023-06-05T15:53:15Z","title":"PolyVoice: Language Models for Speech to Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02982","snapshot_observed_at":"2026-08-07T11:28:48.876266Z","title":"Polyvoice: Language models for speech to speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.876266Z"},"links":{"cited_paper":"/paper/2306.02982","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:16b2e22289bd45dea4d73692c5addac40ee3a213686d566d4322b57ff4703b6b","observation_id":"a17fd686-12f2-4ec2-b5a1-979ad80e7a4b","resolution":{"observed_at":"2026-08-07T11:28:48.876266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-07T11:28:48.957781Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.957781Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:180147182457b647f4df673407f2d610dfdc6778498bb5ea82bc51ca7d1a5d3a","observation_id":"0ed51a5e-b3e9-4b28-9310-5c372fc528a5","resolution":{"observed_at":"2026-08-07T11:28:48.957781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18332","last_updated":"2024-07-08T08:53:26Z","snapshot_observed_at":"2026-07-06T18:52:07.765911Z","submitted_at":"2024-07-08T08:53:26Z","title":"Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2407.18332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.18332","snapshot_observed_at":"2026-08-07T11:29:07.925172Z","title":"Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation","venue":"eess.AS","work_id":"2ee17553-074e-4a0e-bc51-e926bff37517","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.074528Z"},"links":{"cited_paper":"/paper/2407.18332","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:43d82163c76ea4735b81c0e49f353fabc2e4d0ba6656e354928d0e3021fa58d0","observation_id":"4826969a-6b2d-429a-8547-47185ea11b6d","resolution":{"observed_at":"2026-08-07T11:29:08.081160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.184864Z","title":"Enhancing expressivity transfer in textless speech-to-speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.184864Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1216a678173bb0303705c045fdbf1ef6928272cb4357cbaafa3f569adbc7e83b","observation_id":"0eac4a58-04d9-427d-bad9-8e49c446503e","resolution":{"observed_at":"2026-08-07T11:28:49.184864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.309000Z","title":"Towards massive parallel corpus creation for hausa-to-english machine translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.309000Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:5b5bc3388b23a8f8726f34b006dd72a3ccb19e1c22d6ef578b0992e5dcb5beda","observation_id":"bb15fd2f-4b1b-47a7-8885-81dd702209da","resolution":{"observed_at":"2026-08-07T11:28:49.309000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.422521Z","title":"Auditory-visual perception of speech","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.422521Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:dd5f31896d9fa6698d088f2e53f6e8d7eea4f2ae7e57fe3feb0cf6d0e4a5dd1d","observation_id":"43061353-529b-4bd1-b9e2-4e95189b84e7","resolution":{"observed_at":"2026-08-07T11:28:49.422521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.526893Z","title":"Cascade or direct speech translation? a case study","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.526893Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4073c8ce67075ee3283040ce08765cc800ecd93e50a658611215ce101109e488","observation_id":"91bd5a83-bffa-449d-ab01-199c8b972f30","resolution":{"observed_at":"2026-08-07T11:28:49.526893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07330","last_updated":"2024-06-11T15:00:33Z","snapshot_observed_at":"2026-08-02T07:50:06.611716Z","submitted_at":"2024-06-11T15:00:33Z","title":"CTC-based Non-autoregressive Textless Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07330","snapshot_observed_at":"2026-08-07T11:28:49.651108Z","title":"Ctc-based non-autoregressive textless speech-to-speech translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.651108Z"},"links":{"cited_paper":"/paper/2406.07330","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:6eca2a4996d2576d92382b06347e74a1c4ae822beb73a035126980e728e635fa","observation_id":"e5b44b4b-c15b-4aa9-b989-426f7342c4ab","resolution":{"observed_at":"2026-08-07T11:28:49.651108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07289","last_updated":"2024-06-11T14:17:12Z","snapshot_observed_at":"2026-07-06T18:28:55.652937Z","submitted_at":"2024-06-11T14:17:12Z","title":"Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?","version":1},"cited_work":{"arxiv_id":"2406.07289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07289","snapshot_observed_at":"2026-08-07T11:29:07.610253Z","title":"Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?","venue":"cs.CL","work_id":"afb7e692-6be3-4d25-84ea-220bec1a1f0b","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.736451Z"},"links":{"cited_paper":"/paper/2406.07289","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2915a32ebfeede6bb00d49ecee088f27eb310f61b18cc8c32430ed1f063ad25d","observation_id":"b5a56457-cccd-405c-a2f8-3d656195576b","resolution":{"observed_at":"2026-08-07T11:29:07.737070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.823671Z","title":"Generative learning of the solution of parametric partial differential equations using guided diffusion models and virtual observations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.823671Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7e65e7c12247ba020406159a7700bc14643e70aba7dae45ebed3fe259cd0024c","observation_id":"aef21d98-ff4e-4d1a-b6bc-c81f4bd7ba12","resolution":{"observed_at":"2026-08-07T11:28:49.823671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.953797Z","title":"Unsupervised speech technology for low-resource languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.953797Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f1c91da9574c0dd548546a2fd0f54e4fe111e18ef099e29270fb0c70baadb03d","observation_id":"2623a34d-a06c-4916-b297-75ecf9cc5921","resolution":{"observed_at":"2026-08-07T11:28:49.953797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.060496Z","title":"Speech-to-speech translation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.060496Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:36dcbb9f8c8ea68a70b1278d181cd295f2d699c5c5dfe516b87e40caa94b2108","observation_id":"0da42731-d665-45ed-a794-9f9946f11ffa","resolution":{"observed_at":"2026-08-07T11:28:50.060496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07616","last_updated":"2024-04-11T10:08:34Z","snapshot_observed_at":"2026-07-06T17:58:43.506575Z","submitted_at":"2024-04-11T10:08:34Z","title":"Audio Dialogues: Dialogues dataset for audio and music understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07616","snapshot_observed_at":"2026-08-07T11:28:50.157071Z","title":"Audio dialogues: Dialogues dataset for audio and music understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.157071Z"},"links":{"cited_paper":"/paper/2404.07616","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:64a57879fc081d3a5750da3e3ede5b95b3fd8ec0395c8ba284b28276ae79f7fb","observation_id":"6e31a667-aa47-4940-9947-2d4e8bbd8fba","resolution":{"observed_at":"2026-08-07T11:28:50.157071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08655","last_updated":"2023-07-17T17:12:44Z","snapshot_observed_at":"2026-07-06T15:54:54.826581Z","submitted_at":"2023-07-17T17:12:44Z","title":"Multilingual Speech-to-Speech Translation into Multiple Target Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08655","snapshot_observed_at":"2026-08-07T11:28:50.237516Z","title":"Multilingual speech-to-speech translation into multiple target languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.237516Z"},"links":{"cited_paper":"/paper/2307.08655","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d95d2b5d3035cdb581d8eb9e897f13b43649ff4a6cb0efc7ef0dc2975706a84a","observation_id":"60b14585-6067-444f-a72e-8091a3e33557","resolution":{"observed_at":"2026-08-07T11:28:50.237516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.328623Z","title":"Joint audio and speech understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.328623Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:dc7cb1f5c9d3a19e5e88927d1c9fb14b2e37078b2cac432593d7609b0e96be21","observation_id":"f8cd0254-62a1-47a9-9fda-2f42e927c5f1","resolution":{"observed_at":"2026-08-07T11:28:50.328623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.423111Z","title":"Tibetan–chinese speech-to-speech translation based on dis- crete units","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.423111Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fd30a57dcfe37609d0d91475730ad667d08090482e4197c223b954ff4ae6c94a","observation_id":"39fa5909-c21d-46eb-a46f-2ee384003423","resolution":{"observed_at":"2026-08-07T11:28:50.423111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.514977Z","title":"Recent advances in discrete speech tokens: A review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.514977Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:41de164a4c738a712a772588859754aee732e0d82c35b3e2ab69b096cca5c9b1","observation_id":"95e3ae8a-f5a0-4b8e-b1b8-f29255c55b25","resolution":{"observed_at":"2026-08-07T11:28:50.514977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-07T13:22:02.333885Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":"2411.14453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-08-07T11:29:07.343009Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","venue":"cs.CL","work_id":"ad1960c3-d599-43e3-868b-b6467aae0bf7","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.617509Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:22159b4dcbd895a2a1db206281f7d7239fe21d073020789a20cf785e67c9dfc3","observation_id":"666aa822-1a2a-4348-bae2-6e5fe90247a1","resolution":{"observed_at":"2026-08-07T11:29:07.434642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.713865Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.713865Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:971e31e8b5cb2baa9e10012dfe47f4b2511c8eb1d5713abcda8865088b0dd767","observation_id":"2022b7aa-ae5c-427c-a578-058301bac9b2","resolution":{"observed_at":"2026-08-07T11:28:50.713865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.772569Z","title":"Physics-inspired approaches in generative diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.772569Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:233fad68e97318b9f1c1197499cd3cd886ac5552321b9c03f6cc22e06d835bbe","observation_id":"fd866ec3-b451-408d-b0a0-8748559e606d","resolution":{"observed_at":"2026-08-07T11:28:50.772569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12477","last_updated":"2024-06-15T14:13:54Z","snapshot_observed_at":"2026-07-06T16:35:27.763870Z","submitted_at":"2023-10-19T05:31:45Z","title":"Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks","version":2},"cited_work":{"arxiv_id":"2310.12477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12477","snapshot_observed_at":"2026-08-07T11:29:07.127706Z","title":"Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks","venue":"eess.AS","work_id":"5727a862-6705-4bc1-91eb-ceb2a3fa9096","year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.849055Z"},"links":{"cited_paper":"/paper/2310.12477","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:ea3e2a0ac55caf14d8d3101abd8113d4af7787be86571d02ada6c24d7ffb8e1a","observation_id":"f355817d-0e17-4169-9cbd-8afe0eb53b49","resolution":{"observed_at":"2026-08-07T11:29:07.249632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.906902Z","title":"Chain-of-thought prompting for speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.906902Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b52f9b89cf9b7ca944efd32d252f33ffb82d84b6fb07c4a98ea18e82c5289cd3","observation_id":"fbc096ac-803e-475f-9254-687f59be384f","resolution":{"observed_at":"2026-08-07T11:28:50.906902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12523","last_updated":"2023-03-02T09:17:01Z","snapshot_observed_at":"2026-07-06T13:13:40.650733Z","submitted_at":"2022-05-25T06:34:14Z","title":"TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation","version":2},"cited_work":{"arxiv_id":"2205.12523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12523","snapshot_observed_at":"2026-08-07T11:29:06.951252Z","title":"TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation","venue":"cs.CL","work_id":"4fc5e5b0-220b-40f1-94af-c6ddbaa33396","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.968083Z"},"links":{"cited_paper":"/paper/2205.12523","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f271c86347529285a39b6f6f78a89e6098e6bb8dab3facd5794e426e1dad91be","observation_id":"a16b2aec-5c45-419e-bdd6-f59e89cb8817","resolution":{"observed_at":"2026-08-07T11:29:07.050233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02733","last_updated":"2024-06-04T19:22:13Z","snapshot_observed_at":"2026-07-06T18:25:31.706930Z","submitted_at":"2024-06-04T19:22:13Z","title":"Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2406.02733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02733","snapshot_observed_at":"2026-08-07T11:29:06.804135Z","title":"Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation","venue":"cs.CL","work_id":"b7cfe620-503e-40d3-aa55-628290008d40","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.039084Z"},"links":{"cited_paper":"/paper/2406.02733","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:486f5bcdb0625d78526b6c82822706ee08e874153d010d19047c28bd262cd805","observation_id":"645479fc-6505-4d81-8dc5-c3e9f1e7c109","resolution":{"observed_at":"2026-08-07T11:29:06.877355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.104629Z","title":"Massively multi- lingual forced aligner leveraging self-supervised discrete units","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.104629Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fba2d0d5211b230fd38e71b96a8d74a9646515aef8dc7c0899829c5a87eaf20e","observation_id":"4f7aa9c0-3d17-439d-b26a-4b34f3d7c969","resolution":{"observed_at":"2026-08-07T11:28:51.104629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10593","last_updated":"2022-04-22T09:33:31Z","snapshot_observed_at":"2026-08-09T01:25:46.332182Z","submitted_at":"2022-04-22T09:33:31Z","title":"LibriS2S: A German-English Speech-to-Speech Translation Corpus","version":1},"cited_work":{"arxiv_id":"2204.10593","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10593","snapshot_observed_at":"2026-08-07T11:29:06.509595Z","title":"LibriS2S: A German-English Speech-to-Speech Translation Corpus","venue":"cs.CL","work_id":"9658dc92-648b-4c05-9701-3b1fc5fac63f","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.219694Z"},"links":{"cited_paper":"/paper/2204.10593","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d691b512256a48cceeb95fcf2c87ed78d5531f62377383405ef520267c4731b9","observation_id":"411f20dd-1332-4924-ac1f-3640152ea1a7","resolution":{"observed_at":"2026-08-07T11:29:06.641946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T11:28:51.286122Z","title":"Wavchat: A survey of spoken dialogue models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.286122Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e5689fad4fa6069c36218a4047c3b3bf87e98db7e9b11818b9f9eb557e04d048","observation_id":"b3c742b7-aa8e-4ea6-b906-76cf35b79278","resolution":{"observed_at":"2026-08-07T11:28:51.286122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07890","last_updated":"2025-09-12T08:50:31Z","snapshot_observed_at":"2026-08-07T17:14:52.317538Z","submitted_at":"2025-03-10T22:15:51Z","title":"Can Generative Geospatial Diffusion Models Excel as Discriminative Geospatial Foundation Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07890","snapshot_observed_at":"2026-08-07T11:28:51.380557Z","title":"Can generative geospatial diffusion models excel as discriminative geospatial foundation models? arXiv preprint arXiv:2503.07890, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.380557Z"},"links":{"cited_paper":"/paper/2503.07890","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:48de6018875e4042163c7b5c5899ecc643511e22bc93d4e07caab398fdea4e5c","observation_id":"73b92d89-70e8-41c1-936a-f94529374e76","resolution":{"observed_at":"2026-08-07T11:28:51.380557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.433996Z","title":"Listra automatic speech translation: English to lingala case study","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.433996Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:916468e432b0b36dccf75183d04a80e8794fdd1b4b23e8506e25c914d640c1e0","observation_id":"2b4fde17-57c6-4b7f-b51f-693b03ae020e","resolution":{"observed_at":"2026-08-07T11:28:51.433996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.582236Z","title":"Gdplan: Generative network planning via graph diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.582236Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:06e97a6fb3bc4a37663371a5dc79020126ea37f0c30da02352eef56381932504","observation_id":"8164b2a9-f011-4b13-8074-1a8b4d7bb00d","resolution":{"observed_at":"2026-08-07T11:28:51.582236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15967","last_updated":"2024-02-25T03:03:34Z","snapshot_observed_at":"2026-08-06T14:20:14.073867Z","submitted_at":"2024-02-25T03:03:34Z","title":"Direct Punjabi to English speech translation using discrete units","version":1},"cited_work":{"arxiv_id":"2402.15967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15967","snapshot_observed_at":"2026-08-07T11:29:06.149244Z","title":"Direct Punjabi to English speech translation using discrete units","venue":"cs.CL","work_id":"432162d8-9364-443b-9f17-c5ffc7bcacb7","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.726334Z"},"links":{"cited_paper":"/paper/2402.15967","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7e5686a459a613b77f387d31e14279bd62ef93707d104833bd7cee56c4ffec38","observation_id":"ffa65f22-3545-4468-a606-d1383c7257be","resolution":{"observed_at":"2026-08-07T11:29:06.313102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.872948Z","title":"Textless unit-to-unit training for many- to-many multilingual speech-to-speech translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.872948Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4324cd0433f26d4e8fd34aed0ee97cef9ea85693a4dbc63b51d2f04662a32de4","observation_id":"47a8994c-a3da-440a-93fb-7ce5beed79f2","resolution":{"observed_at":"2026-08-07T11:28:51.872948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.075185Z","title":"Phi dm-dialog: an experimental speech-to-speech dialog translation system","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.075185Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:33c571be3d3c39c48cfbb5b7ba59e527e3749b265338d0b72764949ffcb7df78","observation_id":"f1df9749-84f9-43fa-a302-e888b5d5135b","resolution":{"observed_at":"2026-08-07T11:28:52.075185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-09T04:52:56.160863Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03382","snapshot_observed_at":"2026-08-07T11:28:52.222146Z","title":"High-fidelity simultaneous speech-to-speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.222146Z"},"links":{"cited_paper":"/paper/2502.03382","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:42c4b5e89628914fd8a53c62107649f735e2ce8ee8885d62c46d758a7f072a64","observation_id":"e1bcde44-36e0-4eca-ae94-34ec2c0fdf4f","resolution":{"observed_at":"2026-08-07T11:28:52.222146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.338122Z","title":"Janus-iii: Speech-to-speech translation in multiple languages","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.338122Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f9c8ed420b4ac0cee95de67f79fc7cb75ca82858a482d50e6ec5a31fc9bb6369","observation_id":"ee857ae4-18f4-4465-91a5-e7e86832f1ea","resolution":{"observed_at":"2026-08-07T11:28:52.338122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-08-06T07:54:31.859843Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-08-07T11:28:52.430942Z","title":"Textless speech-to-speech translation on real data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.430942Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:58f6b4e114ce9570fe83b8af2bc8265b2f1d151db394850dac045301709e04ec","observation_id":"a544d151-2432-4379-afe7-49bd57a39dac","resolution":{"observed_at":"2026-08-07T11:28:52.430942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.488633Z","title":"Video diffusion models are strong video inpainter","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.488633Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2e4a9b344ea43b88109972314454011a8be350f701ed1db07c5963bc04b41136","observation_id":"7bd8c795-7df6-4383-9fdd-0cfa0c5444aa","resolution":{"observed_at":"2026-08-07T11:28:52.488633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.561720Z","title":"Speech proportion and accuracy in simultaneous interpretation from english into korean","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.561720Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c32fb8b3d87529d5d7ea35e08817facb10402e63177f3a6eb1141621a68a69cb","observation_id":"6f212478-dc0f-4540-8470-5ec1cb2360fd","resolution":{"observed_at":"2026-08-07T11:28:52.561720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.627257Z","title":"Diffusion models for audio restoration: A review [special issue on model-based and data-driven audio signal processing]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.627257Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a0269a07d1ecc15c46cdbbc0e4c54f9dbb9cdd0af1416fa23ee628ebbf8e326d","observation_id":"c5462798-f80a-43c7-a9e3-edd0a298c7b6","resolution":{"observed_at":"2026-08-07T11:28:52.627257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.698356Z","title":"Conditional diffusion model for missing value imputation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.698356Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:85c7ce17fd34774324483b1636a6070409239cf0291ca01d59b58c1194c1b0c2","observation_id":"2bfdd863-1ecb-41df-8902-eb01fd97d21a","resolution":{"observed_at":"2026-08-07T11:28:52.698356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14971","last_updated":"2025-08-05T04:59:44Z","snapshot_observed_at":"2026-07-06T19:36:19.567469Z","submitted_at":"2024-10-19T04:29:03Z","title":"BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14971","snapshot_observed_at":"2026-08-07T11:28:52.756373Z","title":"Brainecho: Semantic brain signal decoding through vector-quantized spectrogram reconstruction for whisper-enhanced text generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.756373Z"},"links":{"cited_paper":"/paper/2410.14971","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9e766e00a052780025d8ac9d17b1957c508d5446bb7e2fbad75a36cb75fb8680","observation_id":"69f88707-5b02-41bd-b2e2-f5ae64cbdcff","resolution":{"observed_at":"2026-08-07T11:28:52.756373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-07T11:28:52.822450Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.822450Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f554c42d45a486bc3a5ee14be1506abb2bc4cc23fedacb57fd76e3d8db42ed87","observation_id":"a861450a-14e7-4ae6-b631-4ebdec81cd59","resolution":{"observed_at":"2026-08-07T11:28:52.822450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.889256Z","title":"Textless direct speech-to-speech translation with discrete speech representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.889256Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b34a7525f5e64434800812df4d20ddef5dcbaeb7ce53cb5c618308d14d23909c","observation_id":"c7976c58-03ca-45cc-b81f-0ef8ea4a3323","resolution":{"observed_at":"2026-08-07T11:28:52.889256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00765","last_updated":"2025-04-13T12:50:16Z","snapshot_observed_at":"2026-07-06T20:15:27.167354Z","submitted_at":"2025-01-01T07:55:15Z","title":"Beyond Words: AuralLLM and SignMST-C for Sign Language Production and Bidirectional Accessibility","version":2},"cited_work":{"arxiv_id":"2501.00765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00765","snapshot_observed_at":"2026-08-07T11:29:05.882754Z","title":"Beyond Words: AuralLLM and SignMST-C for Sign Language Production and Bidirectional Accessibility","venue":"cs.CV","work_id":"d8e5f365-2cbb-4ad8-b05e-60c2f32027e9","year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.948623Z"},"links":{"cited_paper":"/paper/2501.00765","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9148863b876cbc758fb634cc044356f09873507f38f22fb70cac79a71bff47f3","observation_id":"396661f3-0e18-4ef1-a595-31a025022a83","resolution":{"observed_at":"2026-08-07T11:29:06.009246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01834","last_updated":"2025-05-27T16:17:52Z","snapshot_observed_at":"2026-07-06T19:44:38.954993Z","submitted_at":"2024-11-04T06:07:53Z","title":"Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01834","snapshot_observed_at":"2026-08-07T11:28:53.047690Z","title":"Align-slm: Textless spoken language models with reinforcement learning from ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.047690Z"},"links":{"cited_paper":"/paper/2411.01834","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fa2f7312ee32df1a3baafdbf1e9f5f2e56afb87c29c723bb0faa1f7feaeeaa4b","observation_id":"ccef7ffc-1061-4497-8b00-b6dc666de485","resolution":{"observed_at":"2026-08-07T11:28:53.047690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.113989Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.113989Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:34efc408bb9c8a0490219ca0908618def68a119b2978292959570fb71520bf0f","observation_id":"70b4be9b-ed03-4861-b1d3-1846e98fd97e","resolution":{"observed_at":"2026-08-07T11:28:53.113989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.190421Z","title":"Handdiffuse: generative controllers for two-hand interactions via diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.190421Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:87d9f0b6fd6b8c54b103ceecb698d1718dc6469340fc64d3cfca4c55a62237c1","observation_id":"79af8f6c-b061-4ac3-88c1-3a856ac09d70","resolution":{"observed_at":"2026-08-07T11:28:53.190421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-07T19:57:13.037270Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T11:28:53.249841Z","title":"A preliminary exploration with gpt-4o voice mode","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.249841Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2c76c95aacd43c2b29981d8df329249f1024333ec630618199d1fe92290f836f","observation_id":"0222dac1-65b2-4a42-b3f4-ba5a3b496eda","resolution":{"observed_at":"2026-08-07T11:28:53.249841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.332770Z","title":"Recent highlights in multilingual and multimodal speech translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.332770Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c2903e091e950cdf977a0c29e93f16c9f1a36e53b8efa3401750fcfbe0211269","observation_id":"550e152a-e5dc-42bc-8b1f-74d8a62b5a70","resolution":{"observed_at":"2026-08-07T11:28:53.332770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.418689Z","title":"Speech-to-speech low-resource translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.418689Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e8606fdd1c6428e1bf8fe16ae3f7570a30b25cb1d1b2e0170bdcda62b6600194","observation_id":"a738617c-b7fd-458e-825c-4d7de2be9be0","resolution":{"observed_at":"2026-08-07T11:28:53.418689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.480148Z","title":"Listening and seeing again: Generative error correction for audio-visual speech recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.480148Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:ad28289c0272dc92ae7ec3b8e89128391c55a51962e0fa8d2007df128b26ae0f","observation_id":"1b92ec96-557f-43f8-a985-c861c919bd5f","resolution":{"observed_at":"2026-08-07T11:28:53.480148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-07-06T20:15:27.167354Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00805","snapshot_observed_at":"2026-08-07T11:28:53.542723Z","title":"Slide: Integrating speech language model with llm for spontaneous spoken dialogue generation.arXiv preprint arXiv:2501.00805, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.542723Z"},"links":{"cited_paper":"/paper/2501.00805","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:bf5c999a4ee3d65ce011bbcb83a4606dcd34f348a872ad21b121b71a316d4fca","observation_id":"497f7294-6426-4c88-8ee4-a722d4b124f6","resolution":{"observed_at":"2026-08-07T11:28:53.542723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.615822Z","title":"Llamapartialspoof: An llm-driven fake speech dataset simulating disinformation generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.615822Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:8d2e9edd2e913d6c434bcf73fbda06c39f24ada53907d925ae2fe555c0eacc86","observation_id":"51da33f3-43af-4f58-b49d-4360c75d864c","resolution":{"observed_at":"2026-08-07T11:28:53.615822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.691843Z","title":"Build llm-based zero-shot streaming tts system with cosyvoice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.691843Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2d0ff86e0f16fe672b7ef82fccef788ac79edcd88783e5e6cf82b8abbe802e1b","observation_id":"d8a008de-eb3f-46d5-a025-6441456e2a81","resolution":{"observed_at":"2026-08-07T11:28:53.691843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.754082Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.754082Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9b31c443d3349bdc0b2d5e98f9bc40e5a97cb75a999b64129a55cae4be547647","observation_id":"7da2b580-0764-4db3-813a-999550cfc9a4","resolution":{"observed_at":"2026-08-07T11:28:53.754082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04877","last_updated":"2025-01-08T23:21:43Z","snapshot_observed_at":"2026-08-05T22:30:01.806600Z","submitted_at":"2025-01-08T23:21:43Z","title":"Real-Time Textless Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04877","snapshot_observed_at":"2026-08-07T11:28:53.813975Z","title":"Real-time textless dialogue generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.813975Z"},"links":{"cited_paper":"/paper/2501.04877","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2c1bb6292d41efc7c7230034c0ec115dd70933b05da4c4559fe582aa18d11916","observation_id":"7fa3d4a9-2460-499f-a34e-4f104d4c58c9","resolution":{"observed_at":"2026-08-07T11:28:53.813975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15814","last_updated":"2025-05-22T16:55:59Z","snapshot_observed_at":"2026-08-07T18:04:26.690487Z","submitted_at":"2025-02-19T17:21:15Z","title":"Slamming: Training a Speech Language Model on One GPU in a Day","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15814","snapshot_observed_at":"2026-08-07T11:28:53.898225Z","title":"Slamming: Training a speech language model on one gpu in a day","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.898225Z"},"links":{"cited_paper":"/paper/2502.15814","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a5f9e4e141dfe5da096d0d2756bf08ec116cc997ae46df3a0fa349cc171c9b96","observation_id":"3cb01864-40b8-4d19-ae41-18a246831544","resolution":{"observed_at":"2026-08-07T11:28:53.898225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10999","last_updated":"2025-05-23T10:37:01Z","snapshot_observed_at":"2026-07-06T19:16:36.688367Z","submitted_at":"2024-09-17T09:04:03Z","title":"Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10999","snapshot_observed_at":"2026-08-07T11:28:53.960789Z","title":"Enhancing low-resource language and instruction following capabilities of audio language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.960789Z"},"links":{"cited_paper":"/paper/2409.10999","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:3d83de2e93107915aae18f28a87970a70786c2c93db3d264e49884e4e889d0f2","observation_id":"809a6685-b873-4b14-9281-a9ece5f55ba6","resolution":{"observed_at":"2026-08-07T11:28:53.960789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.025981Z","title":"Make some noise: Towards llm audio reasoning and generation using sound tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.025981Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9b7bc6ed8a3dfee182b1e3cf9d2f4f1a5c0413ad2f298b229e46077df1f51fbd","observation_id":"f53f924c-240e-4287-b891-99000f3eec12","resolution":{"observed_at":"2026-08-07T11:28:54.025981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.074608Z","title":"Deep networks as denoising algorithms: Sample-efficient learning of diffusion models in high-dimensional graphical models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.074608Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7b94308115601121ade0caf89517f4dc47d940450e589e4cbc550686bd27f654","observation_id":"8e180aeb-c0ca-4e72-9646-087233593a67","resolution":{"observed_at":"2026-08-07T11:28:54.074608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.129617Z","title":"Amharic speech recognition for speech translation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.129617Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fd69dd4eb508ef39c3ab3cea87233aaa5f57dceca662c1aacf0babceee9307c0","observation_id":"e4e61795-1735-49f3-b201-3cbf5270002a","resolution":{"observed_at":"2026-08-07T11:28:54.129617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.215355Z","title":"Parrot: Autoregressive spoken dialogue language modeling with decoder-only transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.215355Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e295935adc7e735c8071803a7aedba6449d9fb7b8682044abf98e47d8ce685d7","observation_id":"85a5e050-475a-4d8f-a090-e283bb7612b0","resolution":{"observed_at":"2026-08-07T11:28:54.215355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.281049Z","title":"Towards to a direct speech to speech for endangered languages in africa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.281049Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f4c82573b65d42c32e54485a6af086dae8cf67095e76800b91e35204f1a79297","observation_id":"beb0db37-1d76-4902-a215-7357bd88f8eb","resolution":{"observed_at":"2026-08-07T11:28:54.281049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00374","last_updated":"2025-02-01T09:24:32Z","snapshot_observed_at":"2026-07-06T20:29:31.116975Z","submitted_at":"2025-02-01T09:24:32Z","title":"A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2502.00374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00374","snapshot_observed_at":"2026-08-07T11:29:05.679080Z","title":"A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation","venue":"cs.CL","work_id":"41404120-680b-4594-b952-b3bf72e87136","year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.358626Z"},"links":{"cited_paper":"/paper/2502.00374","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f7d8f2893b652b4a8047961feb8fb5140668248f24a15938e0f83d2d184f4200","observation_id":"a87d303b-cef5-4093-a2d6-25f6d4b7597b","resolution":{"observed_at":"2026-08-07T11:29:05.757265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T11:28:54.440358Z","title":"Spoken question an- swering and speech continuation using spectrogram-powered llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.440358Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7aa727194a0e4b73215d30ffd98bfd6ead5a6da47554cd41187dfb4533d30d4f","observation_id":"5d30e757-ba22-422a-b20a-df145a1b26f0","resolution":{"observed_at":"2026-08-07T11:28:54.440358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.514589Z","title":"Towards real-time multilingual multimodal speech-to-speech translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.514589Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7f952a8a27379dc61eaf5e7a3506f301281b68d79f4d6c9cb311a0b570d97967","observation_id":"404457b9-4d9e-466b-89c6-ef2fde59496c","resolution":{"observed_at":"2026-08-07T11:28:54.514589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.00768","last_updated":"2020-08-03T10:43:30Z","snapshot_observed_at":"2026-07-06T09:43:58.782799Z","submitted_at":"2020-08-03T10:43:30Z","title":"One Model, Many Languages: Meta-learning for Multilingual Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2008.00768","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.00768","snapshot_observed_at":"2026-08-07T11:29:05.523149Z","title":"One Model, Many Languages: Meta-learning for Multilingual Text-to-Speech","venue":"eess.AS","work_id":"60263e94-27a0-426a-a6a0-424da2a3cf87","year":2020},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.554883Z"},"links":{"cited_paper":"/paper/2008.00768","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1be9001a13bcd640fa100db0b45fed72700294b80c390017e856d549d1cca559","observation_id":"29d563db-e77d-4365-8701-2432871951b3","resolution":{"observed_at":"2026-08-07T11:29:05.595083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.618527Z","title":"Spoken Language Modeling from Raw Audio","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.618527Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:0d0876ba567e33115028217c2ee945bfe103dcfef2915be7ebf7778cbd960ca0","observation_id":"6f82a242-5629-4085-b9f6-6be3c3184587","resolution":{"observed_at":"2026-08-07T11:28:54.618527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02865","last_updated":"2024-09-03T17:59:50Z","snapshot_observed_at":"2026-07-06T19:10:29.880696Z","submitted_at":"2024-09-03T17:59:50Z","title":"Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling","version":1},"cited_work":{"arxiv_id":"2409.02865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02865","snapshot_observed_at":"2026-08-07T11:29:05.364317Z","title":"Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling","venue":"cs.CL","work_id":"493483a9-f216-4de6-b9e7-9c9c9c0ae700","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.661961Z"},"links":{"cited_paper":"/paper/2409.02865","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:bcf237c4cc9d25f61e5133c87549255d6a2cd603b93d8b5705dcac444f8fab7a","observation_id":"a296a4c6-ff87-4be2-ac85-65a5381ba322","resolution":{"observed_at":"2026-08-07T11:29:05.415512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.778940Z","title":"Verbmobil: The use of prosody in the linguistic components of a speech understanding system","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.778940Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1c6d00f703179b122e393f4f31ab477621e2b61ce02dce6958180a02833559aa","observation_id":"04064344-4acb-46fc-8596-1a702b74407a","resolution":{"observed_at":"2026-08-07T11:28:54.778940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23323","last_updated":"2025-06-11T10:02:24Z","snapshot_observed_at":"2026-08-08T16:22:30.510434Z","submitted_at":"2024-10-30T09:44:52Z","title":"Phonology-Guided Speech-to-Speech Translation for African Languages","version":3},"cited_work":{"arxiv_id":"2410.23323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23323","snapshot_observed_at":"2026-08-07T11:29:05.202401Z","title":"Phonology-Guided Speech-to-Speech Translation for African Languages","venue":"eess.AS","work_id":"07ab7488-79f5-4f8a-b1f1-23c70883150e","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.842017Z"},"links":{"cited_paper":"/paper/2410.23323","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:3c37c3e78215db1f5cfbf0654a31fec6d6c5c723a67f00ad47e8e455334b7cda","observation_id":"34d099fb-c96f-4cec-85e7-4e0ec50d7b47","resolution":{"observed_at":"2026-08-07T11:29:05.278205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07867","last_updated":"2024-08-02T15:05:47Z","snapshot_observed_at":"2026-08-03T23:11:25.751151Z","submitted_at":"2024-06-12T04:48:36Z","title":"Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07867","snapshot_observed_at":"2026-08-07T11:28:54.880977Z","title":"Let’s go real talk: Spoken dialogue model for face-to-face conversation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.880977Z"},"links":{"cited_paper":"/paper/2406.07867","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:14c118bf03b44f160537f8d61908fb3f66429251925f89d258a6f93babaf61ea","observation_id":"899aff8c-87f0-48a0-b348-c1531fdc2af2","resolution":{"observed_at":"2026-08-07T11:28:54.880977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18603","last_updated":"2025-07-10T17:52:43Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:56:46Z","title":"Long-Form Speech Generation with Spoken Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18603","snapshot_observed_at":"2026-08-07T11:28:54.976320Z","title":"Long-form speech generation with spoken language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.976320Z"},"links":{"cited_paper":"/paper/2412.18603","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1106e888e03da68db6e57f17f54d0abfbc997ad304ad299f2f914bc1c52753c6","observation_id":"69f5a34b-30cf-4b75-8c5b-9544d342ba84","resolution":{"observed_at":"2026-08-07T11:28:54.976320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T03:40:47.360103Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":165},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 165 outbound references and 3 inbound Pith citation observations for arXiv:2506.02443."}