{"as_of":"2026-08-15T10:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29b3a9fea9454c9a130cd85017aa48514b0ced0ccb2d9b968d5274121625f48c","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:15:28.530654Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09104/citation-record","integrity":"/paper/2501.09104/integrity","json":"/paper/2501.09104/citation-record.json","paper":"/paper/2501.09104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.153598Z","title":"Almost unsupervised text to speech and automatic speech recognition,","venue":null,"work_id":"91f46ad1-1cc6-4f3e-9f6b-38ffae7b5fab","year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.346059Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:2ccaf46beb1c8ea5f8429e5aaef170d401f1d9b57b8e0cf0cb90a9fdba0a3628","observation_id":"19382c3b-43d4-4f07-a5f9-f554ba6d7e2f","resolution":{"observed_at":"2026-08-10T20:15:29.158504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.138119Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,","venue":null,"work_id":"9b154bcd-48cd-42d7-9964-64cab9dafa46","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.351495Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:d296982ec8ed7212a0b849a941832a5bad2e30fa4eba181356a2363c3f1a3404","observation_id":"1cbe7a3b-e633-4f52-b960-bb91073d34ee","resolution":{"observed_at":"2026-08-10T20:15:29.143256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-13T05:55:03.054769Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-10T20:15:28.356241Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.356241Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:30c1f1a3468e0bc948f4a6bd3462c65b4ccc1fe9caf15c4d35ce475fd0b3fea3","observation_id":"ce8b6928-7725-4f9a-ad72-f4fcab158215","resolution":{"observed_at":"2026-08-10T20:15:28.356241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-14T20:49:45.201003Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-10T20:15:28.361491Z","title":"Seamlessm4t-massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.361491Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:a71e6724521a33af3ae8ce96e2e7292f90cf7d772eb58bb540d170f75182857d","observation_id":"e745e0e5-a8ee-4a6a-bcf3-0b8162d14bab","resolution":{"observed_at":"2026-08-10T20:15:28.361491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-14T19:49:40.990836Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T20:15:28.366374Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.366374Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:49c282e10e7c4003f1af34afd252b6b6cfb6dbffb5511ba92b96a5fbf7679bfa","observation_id":"986c61e3-f5ce-4887-9e99-81673de043b5","resolution":{"observed_at":"2026-08-10T20:15:28.366374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.122449Z","title":"Viola: Conditional language models for speech recognition, synthesis, and translation,","venue":null,"work_id":"8477ce4c-1186-47c4-a0f8-615d5d88e53e","year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.371562Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:0d606bbb9218debd85aab1e78d2aaccebbfb975758655b20329e17a301dab612","observation_id":"5070c066-6467-47c6-9d22-90b4fb84ef2b","resolution":{"observed_at":"2026-08-10T20:15:29.127478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-14T17:40:31.626392Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-10T20:15:28.376868Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.376868Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:d9c52438de000037e1aa986955c2fe233aa919de0063c84e714c9cc855f7ccd4","observation_id":"210853eb-d742-4853-9626-2bc877e506f7","resolution":{"observed_at":"2026-08-10T20:15:28.376868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12654","last_updated":"2024-08-27T02:22:00Z","snapshot_observed_at":"2026-08-13T04:14:53.735819Z","submitted_at":"2024-02-20T02:04:38Z","title":"OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12654","snapshot_observed_at":"2026-08-10T20:15:28.381704Z","title":"Owsm-ctc: An open encoder-only speech foundation model for speech recognition, translation, and language identification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.381704Z"},"links":{"cited_paper":"/paper/2402.12654","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:c50318caf72b37ba1d7d816df20baff5bc73f171b31b48028bea5937da828665","observation_id":"e92e1ccd-e614-476f-b7f5-bd0aca3b7af6","resolution":{"observed_at":"2026-08-10T20:15:28.381704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.387144Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.387144Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:27fb290770fda8984e9a9544516f185cc1c39dbad8dd3a164ad7d9eadc69c331","observation_id":"e185ac2e-fefd-4400-94fb-57479b7a0087","resolution":{"observed_at":"2026-08-10T20:15:28.387144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.391635Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.391635Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:c84562a83b6f335d12ace120b43b5465eb717bd012299b8f4c4ccbb0502ad902","observation_id":"9d7e56b1-3251-4f64-8795-59b5b151f0e1","resolution":{"observed_at":"2026-08-10T20:15:28.391635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.084861Z","title":"Joist: A joint speech and text streaming model for asr,","venue":null,"work_id":"027b19ce-4ecf-42d4-817c-f67e988042ef","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.396298Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:fd7b9db28c28cecf353bace529fa6a1c90b9ab6076a6183038d03ab29f910680","observation_id":"9135e5b5-2be5-4f6a-9626-61a1d0b3309e","resolution":{"observed_at":"2026-08-10T20:15:29.090188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.069164Z","title":"Integrating text inputs for training and adapting rnn transducer asr models,","venue":null,"work_id":"c1729203-bef7-4402-8109-6c5ce4f4c06d","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.401786Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:5d435b4c412a5fec1ac9eda5c953e87fb6b9b2ae97913594c2f68b07258d8636","observation_id":"f8c5f476-a811-4f5a-a647-fdfd02816f7a","resolution":{"observed_at":"2026-08-10T20:15:29.074509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.051805Z","title":"Semi-autoregressive streaming asr with label context,","venue":null,"work_id":"b0856e2f-a089-4d03-ac84-6ffc97b5ba51","year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.406510Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:a21f24c16764b820c9751613fd68752fdb6557c58f20a589b26d23362a5717fd","observation_id":"3c595c02-b884-4bc0-8e2e-5249f72347bb","resolution":{"observed_at":"2026-08-10T20:15:29.057689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14233","last_updated":"2020-10-24T09:35:37Z","snapshot_observed_at":"2026-08-13T21:14:16.165184Z","submitted_at":"2020-10-24T09:35:37Z","title":"Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment","version":1},"cited_work":{"arxiv_id":"2010.14233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.14233","snapshot_observed_at":"2026-08-10T20:15:28.755431Z","title":"Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment","venue":"eess.AS","work_id":"539e0ffd-3c2b-48a7-8031-383a43b65548","year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.411135Z"},"links":{"cited_paper":"/paper/2010.14233","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:63ff60dea5aa5e1c85a69be96386ebe52eb95f592c335af118f2069a75591236","observation_id":"c82be303-93f6-488a-b8f6-e55b71a57ae6","resolution":{"observed_at":"2026-08-10T20:15:28.760841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08700","last_updated":"2020-08-17T09:15:58Z","snapshot_observed_at":"2026-08-05T12:34:29.435807Z","submitted_at":"2020-05-18T13:30:16Z","title":"Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict","version":2},"cited_work":{"arxiv_id":"2005.08700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08700","snapshot_observed_at":"2026-08-10T20:15:28.733360Z","title":"Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict","venue":"eess.AS","work_id":"14b09c14-0623-4cbe-8b1f-f9d36f524250","year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.416162Z"},"links":{"cited_paper":"/paper/2005.08700","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:8d307aed300ceff5eda57224af954901d87d38b2cf52a18cd9c367cddd94a629","observation_id":"6d57ffeb-8354-48c8-b6a0-a6e84ac19d02","resolution":{"observed_at":"2026-08-10T20:15:28.738910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16663","last_updated":"2023-04-20T01:23:54Z","snapshot_observed_at":"2026-08-13T13:53:54.378602Z","submitted_at":"2022-10-29T18:19:44Z","title":"BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model","version":2},"cited_work":{"arxiv_id":"2210.16663","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.16663","snapshot_observed_at":"2026-08-10T20:15:28.708245Z","title":"BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model","venue":"eess.AS","work_id":"85e2e335-0155-4348-8d3b-a0555a451436","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.421118Z"},"links":{"cited_paper":"/paper/2210.16663","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:f5f1b238762100e32758f7e21162995fa0618a91b639564ac68f17ab6cb4b6a0","observation_id":"a5baa8fd-78f8-46dc-bc2c-7badce02f133","resolution":{"observed_at":"2026-08-10T20:15:28.715509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.035059Z","title":"Bectra: Transducer-based end-to-end asr with bert-enhanced encoder,","venue":null,"work_id":"6562ff5c-0016-4592-ac09-be197479e0f0","year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.426110Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:af7250c765bf46b01c911d1a05e8f473b4478faebb2f66a497b0eca610832edb","observation_id":"2e82dfc9-12b7-4d54-9ae0-f774b1688393","resolution":{"observed_at":"2026-08-10T20:15:29.040118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.016131Z","title":"Mask-conformer: Augmenting conformer with mask-predict decoder,","venue":null,"work_id":"2ae03ba7-d2d4-483e-a65f-c081f1b3eee0","year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.430810Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:a0c8a0cc1134b60384ef519a88e58428fd7562adb896f1c8f28e6f18ae89a643","observation_id":"52ffb3d8-360b-4cb8-bd8d-dddbaa6cada6","resolution":{"observed_at":"2026-08-10T20:15:29.022217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.435399Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.435399Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:bf129ef55bc9a9726330926907f86f2410c5e1a94af7b660f5a3ae145fd3cb73","observation_id":"5e40e57e-16cc-46c1-93a4-c962b429327d","resolution":{"observed_at":"2026-08-10T20:15:28.435399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.440501Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.440501Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:925c862c030070c8af5081cc1eef9a80ed22aa8ca2d6e25065971ebf7d86f1bf","observation_id":"afc07b86-e777-44ab-b611-e14c315d9f89","resolution":{"observed_at":"2026-08-10T20:15:28.440501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-13T16:08:20.566487Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-10T20:15:28.445462Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.445462Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:4d9c3b9fc38327ed323f606c449a63a09b83c3a5f040f357dab6dbeca6458782","observation_id":"7279e4c5-b81f-4fdb-b014-702de35ec5c3","resolution":{"observed_at":"2026-08-10T20:15:28.445462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.450541Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.450541Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:d6022d4e3a320a6fcd5ab0bbb4247617edd684af3360013561c69a34900cfe46","observation_id":"3d529b1a-5af5-4d0c-a21c-e91333cc6ae9","resolution":{"observed_at":"2026-08-10T20:15:28.450541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17230","last_updated":"2024-06-13T05:19:12Z","snapshot_observed_at":"2026-08-13T21:33:37.822559Z","submitted_at":"2024-01-30T18:18:27Z","title":"ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17230","snapshot_observed_at":"2026-08-10T20:15:28.455695Z","title":"Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.455695Z"},"links":{"cited_paper":"/paper/2401.17230","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:a121900850d8f236ba96701a8ef22dd6cc7be3fcaad8b41c23c611af16ebc14c","observation_id":"82b3c130-1de6-46c1-aa51-3fb9b5a1f987","resolution":{"observed_at":"2026-08-10T20:15:28.455695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.962434Z","title":"The lj speech dataset,","venue":null,"work_id":"4c54974f-0ea1-4f69-a0a7-bda75539f018","year":2017},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.460414Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:6b9d7d23b3b010be555d9be9de3e236e4d1adc1a3ce43d0beb7b57530256776f","observation_id":"96cce75b-7029-453f-9f93-4549ae9cf4fe","resolution":{"observed_at":"2026-08-10T20:15:28.967736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-14T16:51:22.656133Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-10T20:15:28.464814Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.464814Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:b8cbb7b5b89f734ad3e69b68685cb55996648b4389239cc740f09925ee7373f0","observation_id":"348305b0-a045-4aff-8f80-e15c448bc940","resolution":{"observed_at":"2026-08-10T20:15:28.464814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.469522Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.469522Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:383e2bb63006273c082efb39c72b2c7731689798461f7a78862a3bbcfa53f626","observation_id":"442bc79f-1de7-4d20-913a-e655ee78199b","resolution":{"observed_at":"2026-08-10T20:15:28.469522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-08-13T11:29:44.547086Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-10T20:15:28.474447Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.474447Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:e62604f081767ff43df3cae6588fb11bd26a95a8c58ab08cb2cd6fef49eb5cbe","observation_id":"7a0bd6be-8bba-440d-92d7-eeb78616a12b","resolution":{"observed_at":"2026-08-10T20:15:28.474447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T20:15:28.480440Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.480440Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:456494bc05a2a5a8818bd552ef8e82fa00a05a49004b7b238d95295d669ee068","observation_id":"dba533ba-213b-44b6-b407-465ed4750d52","resolution":{"observed_at":"2026-08-10T20:15:28.480440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-13T13:28:56.694752Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-10T20:15:28.485951Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.485951Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:7e4a30be266cc48d388950b816df463d899b6de3da79adf1cb1189c02ab781d4","observation_id":"18d15006-6a65-46be-87ac-9ce3b30c07ba","resolution":{"observed_at":"2026-08-10T20:15:28.485951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.491768Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.491768Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:f29ffd03b7782014cd4a48904103e5208cc2c5470fba681e537aa05570c6e579","observation_id":"60d7cb1f-ff83-4449-a370-e8cf45f47c44","resolution":{"observed_at":"2026-08-10T20:15:28.491768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-14T16:44:17.943580Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-10T20:15:28.496296Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.496296Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:deecced324db485b72ba1b1133ee3721967656cab4e4e846c80afe75770f10c3","observation_id":"7701a5c4-ff0c-4c81-bba2-b716a10662c7","resolution":{"observed_at":"2026-08-10T20:15:28.496296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.500917Z","title":"Audio augmentation for speech recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.500917Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:279570f88badd515cd78d09ec1e4a66a6e28e034238c87c275279b969e559731","observation_id":"580a110f-fe7f-4fd9-9ad7-f31e81b52e7c","resolution":{"observed_at":"2026-08-10T20:15:28.500917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.506312Z","title":"Super-convergence: Very fast training of neural networks using large learning rates,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.506312Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:26e9d7a812f42a16fa27a69e42f430ee218357c564dbba577cbfd67ec51a37bb","observation_id":"a30e41ff-9fd7-4bbd-a147-5d29be044c01","resolution":{"observed_at":"2026-08-10T20:15:28.506312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.510887Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.510887Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:60b04b7ee920860ceb4a28fb192936170babcb23e61e0c94cfa36b9a7eb629c7","observation_id":"d0fdf2ab-b8e7-4cb6-b0e6-66a6fa579f6f","resolution":{"observed_at":"2026-08-10T20:15:28.510887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.885888Z","title":"Regularization of neural networks using dropconnect,","venue":null,"work_id":"a971f123-f251-4bd8-be5a-7fe00779c6ef","year":2013},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.516216Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:a7c2bbef0a4e40f9267d1f0c478d15dec9cc7705bfa73d8c49131166809a4804","observation_id":"f4c980a6-9f46-484e-95ff-654787756f49","resolution":{"observed_at":"2026-08-10T20:15:28.891532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.868003Z","title":"Sequence noise injected training for end-to-end speech recognition,","venue":null,"work_id":"3b3795fb-f407-4fc9-824d-e1d64f972143","year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.520889Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:c4c9e3a0fdb93d9a57a295adfbd088d82d4a7c07613893486fdbaeb8de4fb5f8","observation_id":"004df12f-cf94-43a1-b93f-989747bbc029","resolution":{"observed_at":"2026-08-10T20:15:28.873661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02724","last_updated":"2021-10-08T10:00:43Z","snapshot_observed_at":"2026-08-13T19:44:40.324917Z","submitted_at":"2021-04-06T18:00:03Z","title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02724","snapshot_observed_at":"2026-08-10T20:15:28.525732Z","title":"Relaxing the conditional independence assumption of ctc-based asr by conditioning on intermediate predictions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.525732Z"},"links":{"cited_paper":"/paper/2104.02724","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:9cdba7906db4c6c9755f1883a1301bf6858a89a805aa546f256fefd5d1addbd1","observation_id":"9a06238f-8bab-4481-971b-91cb02c8bc78","resolution":{"observed_at":"2026-08-10T20:15:28.525732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-10T20:15:28.530654Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.530654Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:646aa62e7d87886f666dd48ee0d8d3a24f192b604a38c27eb73db1b28389eeab","observation_id":"25f1d255-6d72-4087-87ff-f4a4ff22e5fa","resolution":{"observed_at":"2026-08-10T20:15:28.530654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T10:40:12.338606Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.09104."}