{"as_of":"2026-08-10T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:251f2b3a885328c2c525c354a62e86e66d51c67a55a730dd75b9cd7830156605","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:54:18.819238Z","state":"measured"},{"denominator":107,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":107,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:22:07.252044Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:19:02.895734Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-07T14:22:07.252044Z","title":"Metis: A foundation speech generation model with masked generative pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-09T09:34:05.335498Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.252044Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:accba614bea84bf38ec8612a00165379d779213a8f4e4ce7dbf0dd8a865fb62c","observation_id":"ffb056b2-5e5a-4357-a714-17287e0219e7","resolution":{"observed_at":"2026-08-07T14:22:07.252044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-03T14:20:49.151323Z","title":"Metis: A foundation speech generation model with masked gen- erative pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-09T23:24:19.443679Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.151323Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:b15f89184b5592d32bc5c08c726591ca143b9a63c6afd66a00476e46cae3c09f","observation_id":"59be1fe7-50bc-4cd0-9420-a896d77f6338","resolution":{"observed_at":"2026-08-03T14:20:49.151323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":"2502.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-07-03T23:19:02.895734Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","venue":null,"work_id":"aaf40336-6043-46f6-be70-3deca4a017fd","year":2025},"citing_paper":{"arxiv_id":"2606.18323","last_updated":"2026-06-16T15:41:44Z","snapshot_observed_at":"2026-08-06T02:49:06.057401Z","submitted_at":"2026-06-16T15:41:44Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T22:46:47.786929Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2606.18323"},"observation_digest":"sha256:3aa6e1668b192c86fc1fed9c926bad8c89a8b7f9562ff787851c6e83e602f76e","observation_id":"5be49d1f-980f-499b-93b9-695450da0e11","resolution":{"observed_at":"2026-07-03T23:19:02.898806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":"2502.03128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-07-03T23:19:02.895734Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","venue":null,"work_id":"aaf40336-6043-46f6-be70-3deca4a017fd","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":203,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:ccac9e7b891d2cb8bcc427792980c5debfbea3437f202ea82343b0d24b51cd7e","observation_id":"fe196cd4-f51f-4a5a-9ce6-6f3312196439","resolution":{"observed_at":"2026-07-01T11:45:47.149531Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-07-11T21:24:36.925360Z","title":"Metis: A foundation speech generation model with masked generative pre-training.arXiv preprint arXiv:2502.03128, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04140","last_updated":"2026-07-05T06:45:47Z","snapshot_observed_at":"2026-08-06T05:51:10.452020Z","submitted_at":"2026-07-05T06:45:47Z","title":"DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T21:24:36.925360Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2607.04140"},"observation_digest":"sha256:aef0d54995300218e09964fee95d659343542b57600ee915e12ed9228fe9e559","observation_id":"a6be6d39-106f-4b77-9a27-073f67aa5b06","resolution":{"observed_at":"2026-07-11T21:24:36.925360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-07-14T06:45:43.330341Z","title":"Metis: A foundation speech generation model with masked generative pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T06:45:43.330341Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:a8cfc77edd12766c95b81d55d6a044284af3c98247716d5ef32ce9fbb93ad203","observation_id":"cddd88ed-459f-40af-b8f9-d782ac39fceb","resolution":{"observed_at":"2026-07-14T06:45:43.330341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-02T07:05:05.797563Z","title":"Metis: A foundation speech generation model with masked generative pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:05:05.797563Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:8d8fc0ade309a62bae1ecbbc7a3783caa495da174cdeec9e00c8a0a15406fb8b","observation_id":"31f23d98-8ad1-4700-a8d9-f6089db8771c","resolution":{"observed_at":"2026-08-02T07:05:05.797563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03128/citation-record","integrity":"/paper/2502.03128/integrity","json":"/paper/2502.03128/citation-record.json","paper":"/paper/2502.03128"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.378414Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.378414Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ed85c64c1e013d0c96b7f3c73925a2a133944364d6ed79f165bb1efd6fe03c6b","observation_id":"078fdd36-19a2-4805-bf67-b57f4715db1c","resolution":{"observed_at":"2026-08-09T05:54:18.378414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T05:54:18.384234Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.384234Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:3a81cb958be4acc0c5bc8c662f266b983c5c2a48b53922f89e8df720b2003673","observation_id":"aa735e97-4d1b-4b88-8167-547e681c3894","resolution":{"observed_at":"2026-08-09T05:54:18.384234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-09T05:54:18.389057Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.389057Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:56b1e51fc1fc41821345aae72965a26e0f3727dcb74a35ab9a33271db7b642c8","observation_id":"874190da-82b6-4c2a-b0a5-6489711d148e","resolution":{"observed_at":"2026-08-09T05:54:18.389057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06674","last_updated":"2024-04-11T17:52:15Z","snapshot_observed_at":"2026-08-09T00:10:20.232518Z","submitted_at":"2024-04-10T01:33:08Z","title":"VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06674","snapshot_observed_at":"2026-08-09T05:54:18.393875Z","title":"Voiceshop: A unified speech-to-speech framework for identity-preserving zero-shot voice editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.393875Z"},"links":{"cited_paper":"/paper/2404.06674","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:f591058f73eb6c73281591cb2e23874fa4e33dff8d4cad00c6f6f598cccea68c","observation_id":"c2974013-dc9e-4bfe-ba11-fa1f12cffff2","resolution":{"observed_at":"2026-08-09T05:54:18.393875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-09T05:54:18.398909Z","title":"M., and Weber, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.398909Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:6117add1bee8a25e17ba12112c8fb253d8f5f084eadb2baa639da1610b93cc5e","observation_id":"02251048-9c56-4018-b48c-6bc4fd013b8d","resolution":{"observed_at":"2026-08-09T05:54:18.398909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18975","last_updated":"2023-05-30T12:19:07Z","snapshot_observed_at":"2026-07-06T15:35:22.185803Z","submitted_at":"2023-05-30T12:19:07Z","title":"Voice Conversion With Just Nearest Neighbors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18975","snapshot_observed_at":"2026-08-09T05:54:18.403711Z","title":"Voice conversion with just nearest neighbors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.403711Z"},"links":{"cited_paper":"/paper/2305.18975","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:32842f1e53a6c9fcdb1904f8362dd3dc073c0e93c1ea278e2fa87687e6bc8fdf","observation_id":"e738f8d8-31f3-4e88-ad1c-18dcd74638b8","resolution":{"observed_at":"2026-08-09T05:54:18.403711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-09T05:54:18.408360Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.408360Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:cef5b25ca930ed3333bb1a4571d53ec55fbf28993dbda6299073e5d89917a153","observation_id":"85f342eb-cef5-4a8a-9753-3bf6a6872a55","resolution":{"observed_at":"2026-08-09T05:54:18.408360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-09T05:54:18.413462Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.413462Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:5e2465f105d46e388573ee3c6ad7caddc651bcb5c9e6dadf4bc7093ebfffa7cd","observation_id":"7e187116-59ac-4d0d-acb4-a1785930ef6c","resolution":{"observed_at":"2026-08-09T05:54:18.413462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.418329Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.418329Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:793d663d14b2e5638a162b4f259c37868414316ff8f9762cc234b2895825ccac","observation_id":"49244d92-a743-4a79-a993-d510d3eefd72","resolution":{"observed_at":"2026-08-09T05:54:18.418329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-09T05:54:18.422665Z","title":"Soundstorm: Efficient parallel audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.422665Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:1d94a9f294ce01d6ce4fdb581aa5bbca2ea78c36604b2d442a5f656fbbaca237","observation_id":"0e5b5ae6-4a89-4b0c-acfe-8aa21b53d497","resolution":{"observed_at":"2026-08-09T05:54:18.422665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-09T05:54:18.427049Z","title":"o lge, E., G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.427049Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ad40f4ceab4dcd9690885ece9ed1db6f590c6366f80cca948e349a3f952726c7","observation_id":"4addb919-8823-4a23-bd6d-f0e0d6cfc1ba","resolution":{"observed_at":"2026-08-09T05:54:18.427049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.431531Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.431531Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:8cd3dfdab4eb7c1fc57dd58b5721a8a72793ac83491d8bf3ae63f48846e542bd","observation_id":"3b887fea-28bc-4be0-aa05-17577a1bd9b4","resolution":{"observed_at":"2026-08-09T05:54:18.431531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-09T05:54:18.435628Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.435628Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2d9772efea15e8164ae03488202e59c44a39dc11af738a63db58cd17b550a7e5","observation_id":"8ab7713c-374a-45dc-a085-e8a845ca2ad3","resolution":{"observed_at":"2026-08-09T05:54:18.435628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-09T05:54:18.440103Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.440103Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:b0f963322722415a4240a7f8675247cf4710c311dc27974a3aaeebfccc957ee0","observation_id":"3bf0e655-85f2-4d3f-9b8b-37945160f7b0","resolution":{"observed_at":"2026-08-09T05:54:18.440103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.444712Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.444712Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:fbe9f65212e80785f7b921a678d87c845295c5df66991c3e0697c68248444f92","observation_id":"bf1b8ddc-77ca-4774-98c5-0d95aae76a1d","resolution":{"observed_at":"2026-08-09T05:54:18.444712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.448981Z","title":"Streaming voice conversion via intermediate bottleneck features and non-streaming teacher guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.448981Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:4975cfc300a926368d0ad78fdc1ef8b5298f3e99763974cf4610ce112c14a8a9","observation_id":"18c0bd10-8677-4536-8701-5c0ea894574c","resolution":{"observed_at":"2026-08-09T05:54:18.448981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.453446Z","title":"Self-supervised learning with random-projection quantizer for speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.453446Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:79c11233c620b129f551f50a2eb000ef7559ce15a507d15ff1b227e52f4789cb","observation_id":"e2963741-253b-434f-a6a8-99f3d43adfd4","resolution":{"observed_at":"2026-08-09T05:54:18.453446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.457801Z","title":"Diff-hiervc: Diffusion-based hierarchical voice conversion with robust pitch generation and masked prior for zero-shot speaker adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.457801Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:22daebc5bca275b3d3b181de8a7bbbbc789aca33a1eeeac8ac9aa823faf565fd","observation_id":"26033474-b91d-4c1c-bfeb-983bcc84e4b6","resolution":{"observed_at":"2026-08-09T05:54:18.457801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19603","last_updated":"2023-05-31T07:17:32Z","snapshot_observed_at":"2026-07-06T15:35:49.019768Z","submitted_at":"2023-05-31T07:17:32Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19603","snapshot_observed_at":"2026-08-09T05:54:18.462539Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.462539Z"},"links":{"cited_paper":"/paper/2305.19603","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ea4cf960466153adfb6f3147c4649854deb381ed83d71123a4169557275069ee","observation_id":"18e1d699-ac5c-432a-9943-863877db5bdd","resolution":{"observed_at":"2026-08-09T05:54:18.462539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.466972Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.466972Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:d0c9b8d212ec1ec96c81a1102aac35e05c1ffb49d080f454f0e0e8eab6078686","observation_id":"15cd84d7-9ff7-483f-9f7f-bd2a928f4861","resolution":{"observed_at":"2026-08-09T05:54:18.466972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-09T05:54:18.471270Z","title":"Librimix: An open-source dataset for generalizable speech separation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.471270Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ca09571cfc184e08bec61d3d68510aba26e072f3c7010470ed2ffd7bc66eb02c","observation_id":"81187307-ea8b-4b5f-8e4b-937abbb286a9","resolution":{"observed_at":"2026-08-09T05:54:18.471270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-09T05:54:18.475968Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.475968Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:13dffa17c3fc47713f974dbde0b48725ec04bd6e9b3de3237b8144288c1de662","observation_id":"25c42fac-eceb-42b9-86e1-70d678caea7a","resolution":{"observed_at":"2026-08-09T05:54:18.475968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T05:54:18.480389Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.480389Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:4137be18e3213d79da5fcb71d331f88ed89163a85b4d3daf8f8c85cf98a73f3c","observation_id":"76096e5b-58f1-4b4b-9742-2e2851733e26","resolution":{"observed_at":"2026-08-09T05:54:18.480389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.484930Z","title":"I., Waldner, F., Caccetta, P., and Wu, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.484930Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:997a6c46be92a9ffdc64aea9c89dc7b7c2adc23acd3e1cccc44a687dcb205446","observation_id":"bbda1223-8e06-4cd4-88a2-fdc2d3aaf3c5","resolution":{"observed_at":"2026-08-09T05:54:18.484930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-09T05:54:18.489311Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.489311Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:58c7af574a7389c3cabc1fb32bb6b8d77e56b298a537d8e5caacc927c7343674","observation_id":"e4e5f573-73db-400a-898c-7f3fb56cab33","resolution":{"observed_at":"2026-08-09T05:54:18.489311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.493798Z","title":"Icassp 2023 deep noise suppression challenge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.493798Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:1dd1c7dcb1a4c41381d688b98031ca6ad26988e904360d9782ae96515fd49fe3","observation_id":"3c089544-da15-42bf-8f53-fb11bb675a1f","resolution":{"observed_at":"2026-08-09T05:54:18.493798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.498038Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.498038Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:3cbc62eb6ba3b84cd17d2f678b56a29ed13ee3d26b3056c3319c835daa80d553","observation_id":"ebedc275-c7ac-45db-af72-95d012609230","resolution":{"observed_at":"2026-08-09T05:54:18.498038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03538","last_updated":"2021-06-04T09:15:25Z","snapshot_observed_at":"2026-08-07T02:34:36.889171Z","submitted_at":"2021-04-08T06:46:35Z","title":"MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03538","snapshot_observed_at":"2026-08-09T05:54:18.502297Z","title":"Metricgan+: An improved version of metricgan for speech enhancement","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.502297Z"},"links":{"cited_paper":"/paper/2104.03538","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:eed5e809a9f5bf4c6c3c6f9ee55dd40420cef50b15ff5743550daf941f033df8","observation_id":"f50c2960-5819-4513-a7f5-8bbc77fc416d","resolution":{"observed_at":"2026-08-09T05:54:18.502297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-09T05:54:18.506600Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.506600Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2d0f78d50561ea7943a75dcc17916d2567fe9d231ab17cd3045db05f7852a620","observation_id":"1b89e85a-0dd9-495a-aa05-62feb8f82cbd","resolution":{"observed_at":"2026-08-09T05:54:18.506600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-08T00:35:10.506000Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-09T05:54:18.511185Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.511185Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:0d0c01126b4a14fa9703f455babbeddab0e6a515cb92b6294af318a38eb52662","observation_id":"e4b04887-867e-437a-b4fc-f3046be5db61","resolution":{"observed_at":"2026-08-09T05:54:18.511185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-09T05:54:18.515495Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.515495Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:d38baa92711aa4890b23df21267c7623b1c5decd809153aabdcb57146f145b67","observation_id":"16b86198-926d-4bcc-a65a-e4a8158e5670","resolution":{"observed_at":"2026-08-09T05:54:18.515495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.519972Z","title":"Didispeech: A large scale mandarin speech corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.519972Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:645084867d6a57da386651a90b5bd74aa6da1aefcd133db6a0585f1ca902dc0b","observation_id":"e3bba317-7182-4ecc-b6e8-88d69cfe9217","resolution":{"observed_at":"2026-08-09T05:54:18.519972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-09T05:54:18.525240Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.525240Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2c9f7b1cb969e2282f47f88842ceda10b3d859fab65abaea165947c88eba57b6","observation_id":"12b976f6-b36a-401e-b381-059329f04c31","resolution":{"observed_at":"2026-08-09T05:54:18.525240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.529842Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.529842Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:73edf929c5f8180f339462b222a2c32bdfebc112a2a40bd2cc9b222135abc2e8","observation_id":"68af5c54-7455-483a-86c5-30ee8222e7c7","resolution":{"observed_at":"2026-08-09T05:54:18.529842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-09T05:54:18.534140Z","title":"and Salimans, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.534140Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:3172355be2eff47992dbf8c4beffb907a9d4a970266becee28277f9d54c01083","observation_id":"21cb90a7-ee37-44c2-a596-65417a424889","resolution":{"observed_at":"2026-08-09T05:54:18.534140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.538720Z","title":"H., Lakhotia, K., Salakhutdinov, R., and Mohamed, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.538720Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:8b185a0a0f2f6bb1c097c7391136f4f678dcb9dfee3e9d9f1c71defaa0f4bfc6","observation_id":"e7798344-d706-4998-bd82-1599446ffc3b","resolution":{"observed_at":"2026-08-09T05:54:18.538720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T05:54:18.543003Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.543003Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2e6b950b68d522585c86d1c0e1f7222694018a413ccdc427350a2eecf1e193e6","observation_id":"385a03f1-8709-46ec-9beb-0ec9b66dbd8b","resolution":{"observed_at":"2026-08-09T05:54:18.543003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05751","last_updated":"2023-08-10T11:49:17Z","snapshot_observed_at":"2026-07-06T14:29:20.607029Z","submitted_at":"2022-12-12T08:02:02Z","title":"Zero-Shot Accent Conversion using Pseudo Siamese Disentanglement Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05751","snapshot_observed_at":"2026-08-09T05:54:18.547292Z","title":"Zero-shot accent conversion using pseudo siamese disentanglement network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.547292Z"},"links":{"cited_paper":"/paper/2212.05751","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:f29958b6225c528f439900c885b501cc78ed101d2e8576401193c974b844e1fc","observation_id":"d10011a1-d3a8-4e72-8096-586ca8304808","resolution":{"observed_at":"2026-08-09T05:54:18.547292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-09T05:54:18.551748Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.551748Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:9cf5e44fa6d356ff48e8abcfd5eda649c4d1b1d752c86b907b8dd5654f4aa8e5","observation_id":"e6ca5bb1-b748-4c44-98be-e0d2b0eca1f9","resolution":{"observed_at":"2026-08-09T05:54:18.551748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.556103Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.556103Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:b48a56be38911e902525a29043f1bb22e299dbb29f302276e8c643cfda898a17","observation_id":"2a955d75-8abb-488e-a61a-1808cfe3b27e","resolution":{"observed_at":"2026-08-09T05:54:18.556103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.560652Z","title":"Libriheavy: a 50,000 hours asr corpus with punctuation casing and context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.560652Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:d4780e829897c74b5c0a23d30a463fd91fb0c0eac94f577ee92499657bd93d69","observation_id":"200296fa-2d2e-4df5-bf2a-f248c7c6cadc","resolution":{"observed_at":"2026-08-09T05:54:18.560652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.564817Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.564817Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:5cbe7a2970c25da2f2e20e2fa962e4caf6cf4ec022dbb9a67d6f57fde3fcbf22","observation_id":"7ce94c5b-f42c-488f-961a-8679e1f5255e","resolution":{"observed_at":"2026-08-09T05:54:18.564817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.568816Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.568816Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:0b7387b5102a95935f1a3e166e31040a6f2af0ff05cfb27a8784814491593c49","observation_id":"925a626e-3539-420d-affa-301cb4551749","resolution":{"observed_at":"2026-08-09T05:54:18.568816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.573066Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.573066Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:74bd864858add314cb4d68e970d37642cf45a9d41423f83859562243b29571a0","observation_id":"0d261d34-ae66-4e1c-bf42-20f2e8d4d545","resolution":{"observed_at":"2026-08-09T05:54:18.573066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.577254Z","title":"C., Lo, W.-Y., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.577254Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:282c4e714ad89d869b084807fe8f4cd4f615949ec27389c9f7a0fcaba7438676","observation_id":"7ec50def-0479-43b4-8ac4-996f63c4a057","resolution":{"observed_at":"2026-08-09T05:54:18.577254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.581433Z","title":"L., and Khudanpur, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.581433Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:25d18165afa6760e17584a494e650a27c5797224f338965761e9f616578512ea","observation_id":"8d7fed14-5f30-48e9-9628-4c842d792cd0","resolution":{"observed_at":"2026-08-09T05:54:18.581433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.585757Z","title":"High-fidelity audio compression with improved rvqgan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.585757Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:a34bf0a957e398db2a5066acf8caa2372ff4729d848352d4d65f198dd7e62290","observation_id":"46674634-6c73-4a31-a61a-2cbc1dc3ec08","resolution":{"observed_at":"2026-08-09T05:54:18.585757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-09T05:54:18.590124Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.590124Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:38d1485b4a168a5290beb3ab398fa9a4bac2c522fc4f8ec29b592854f7576f5f","observation_id":"8727cb72-1997-498d-bed3-a1f90fd36d10","resolution":{"observed_at":"2026-08-09T05:54:18.590124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.594841Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.594841Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:3df8a7209bd2bf72af1354c41a06d9e16f376470375ad137df309877a2849a4d","observation_id":"a0583204-a10d-4fd0-b938-e4f94ba2ec2b","resolution":{"observed_at":"2026-08-09T05:54:18.594841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.599012Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.599012Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:4bfa499148d4450c05ab8c2b54587ea8ab0e8a280a722ba668396aeaf2c2f5db","observation_id":"d80736c7-4322-4487-8fbc-7300dd6c239e","resolution":{"observed_at":"2026-08-09T05:54:18.599012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-09T05:54:18.603332Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.603332Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:88215a3a74eb81304799cbb21e11123a77bdd927aa0a334d6ebb4b262e44da82","observation_id":"1e1a0fcb-be09-4d73-934a-3e235b15ca80","resolution":{"observed_at":"2026-08-09T05:54:18.603332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.607943Z","title":"Improved masked image generation with token-critic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.607943Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:1fa888cc85515ff478688bbd87842c54b5029f995d7e3ac7b2c7d44ee306ec48","observation_id":"de6ebac2-1ee9-4832-ae63-c5bfa326fb8a","resolution":{"observed_at":"2026-08-09T05:54:18.607943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.963513Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion","venue":null,"work_id":"4b385666-f13e-41a9-94c8-5742f557e4bb","year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.612106Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:034aa7a61ed075a5125a01eda3bb462dedbb890e42bf786dea046eeb1736bfe8","observation_id":"03fa471d-c8a8-4bcb-b453-e794ff1e7d6b","resolution":{"observed_at":"2026-08-09T05:54:19.968189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02092","last_updated":"2024-06-04T08:23:57Z","snapshot_observed_at":"2026-08-10T04:59:07.642547Z","submitted_at":"2024-06-04T08:23:57Z","title":"MaskSR: Masked Language Model for Full-band Speech Restoration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02092","snapshot_observed_at":"2026-08-09T05:54:18.616170Z","title":"Masksr: Masked language model for full-band speech restoration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.616170Z"},"links":{"cited_paper":"/paper/2406.02092","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:17eb87c84637f6bb7795ae40d5e69a19d59bac3d7a0e46bd164471820e993fca","observation_id":"02c1cd28-f134-41d4-a561-9010244950b7","resolution":{"observed_at":"2026-08-09T05:54:18.616170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-09T05:54:18.620605Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.620605Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:58089e59a626f5aaa89d1c1f9d2c0ae8f03713cbfd819a7cb334272ade36a7f2","observation_id":"1398b445-13fe-4c92-8269-ed1bbf4d2ed1","resolution":{"observed_at":"2026-08-09T05:54:18.620605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-07-06T16:38:09.978805Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-08-09T05:54:18.625064Z","title":"H., Le, M., Vyas, A., Shi, B., Tjandra, A., and Hsu, W.-N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.625064Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:e7cfd931b1d7839ceb9237a47660bf762ef0b57664cf48923e7ba8ba4c763b02","observation_id":"e50b2fdc-66d7-482f-9061-2a2cde300b3e","resolution":{"observed_at":"2026-08-09T05:54:18.625064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13731","last_updated":"2021-10-05T15:52:27Z","snapshot_observed_at":"2026-07-06T11:52:12.204724Z","submitted_at":"2021-09-28T13:51:16Z","title":"VoiceFixer: Toward General Speech Restoration with Neural Vocoder","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13731","snapshot_observed_at":"2026-08-09T05:54:18.629836Z","title":"Voicefixer: Toward general speech restoration with neural vocoder","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.629836Z"},"links":{"cited_paper":"/paper/2109.13731","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:8c4e8fcacb7d65f89a371e030075661fc56fc3793bc6152cd8f5e9ee5a285fa2","observation_id":"391d55a6-a39b-46b9-b727-7a21b7806637","resolution":{"observed_at":"2026-08-09T05:54:18.629836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05841","last_updated":"2022-04-17T10:08:38Z","snapshot_observed_at":"2026-08-03T23:46:58.017549Z","submitted_at":"2022-04-12T14:37:39Z","title":"VoiceFixer: A Unified Framework for High-Fidelity Speech Restoration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05841","snapshot_observed_at":"2026-08-09T05:54:18.634360Z","title":"Voicefixer: A unified framework for high-fidelity speech restoration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.634360Z"},"links":{"cited_paper":"/paper/2204.05841","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:f4c2cad7d80bdeb4059ad521190059d50a0ed9a718b5d9d4dc59d32757b214d2","observation_id":"16ea4b77-fc04-487a-b32a-736cfaecefbe","resolution":{"observed_at":"2026-08-09T05:54:18.634360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-09T05:54:18.639029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.639029Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:6a09133179dbf7d53bfcb86c649e3af76b822ab86d9c93b547cd5cb8d5a3f53c","observation_id":"a087ae35-4672-47b7-bd73-89d62abaedcd","resolution":{"observed_at":"2026-08-09T05:54:18.639029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.643499Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.643499Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:3c35509b1b328fcd082ad35c76281d7e9b4921985bb1473e53aa363e640dff08","observation_id":"e878bbb0-5d97-44ef-8ab1-fe796331a090","resolution":{"observed_at":"2026-08-09T05:54:18.643499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T05:54:18.647739Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.647739Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:806aec443cbd027ee53b3ddb64a2c4b246dd502b17d360ad70daffd12e84630e","observation_id":"a2d25a93-677f-48a3-8304-bbdc21413872","resolution":{"observed_at":"2026-08-09T05:54:18.647739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.652221Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.652221Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:55a90b686a0a7787c3fc0feaf864127e490c82b38d39b738216d871b5c8ec2c5","observation_id":"2f75a97a-e785-4eee-912f-3b2a6d4a7866","resolution":{"observed_at":"2026-08-09T05:54:18.652221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-09T04:16:37.543940Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-09T05:54:18.656523Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.656523Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:715c877ea3644f5d11e8a396f5518ec4507f2ad855ca6994e57768824e714c03","observation_id":"c12aaf43-7de6-45ee-adfd-7cfa2152ef9d","resolution":{"observed_at":"2026-08-09T05:54:18.656523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.931964Z","title":null,"venue":null,"work_id":"822a1990-99da-4546-8e9b-124258a1180e","year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.661197Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:f27dd9fd1c4e29b2eb41f51d4614c750306970bc55318ccf43968acbcf3932e0","observation_id":"f804ab5c-5ea1-4216-b6c9-23861bec9d05","resolution":{"observed_at":"2026-08-09T05:54:19.936454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-09T05:54:18.665957Z","title":"S., and Zisserman, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.665957Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:be375d585c59a42f439cca700f49d5cba36b1d2fc26a2d6ace5179b35de808ed","observation_id":"23b77483-089a-4353-8464-a610bf0b36fa","resolution":{"observed_at":"2026-08-09T05:54:18.665957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09653","last_updated":"2024-05-03T16:45:39Z","snapshot_observed_at":"2026-08-06T04:08:15.236205Z","submitted_at":"2023-10-14T19:51:17Z","title":"SelfVC: Voice Conversion With Iterative Refinement using Self Transformations","version":2},"cited_work":{"arxiv_id":"2310.09653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09653","snapshot_observed_at":"2026-08-09T05:54:19.183829Z","title":"SelfVC: Voice Conversion With Iterative Refinement using Self Transformations","venue":"cs.SD","work_id":"4c7068f8-b61f-4d55-8138-74c412b547c0","year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.670425Z"},"links":{"cited_paper":"/paper/2310.09653","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:03e1aeca461b84008b8ff5c9727e11026323f512515f1701b4a6b6f04289c961","observation_id":"6cb1fde5-ae9d-4721-af48-f8dcd95acb9d","resolution":{"observed_at":"2026-08-09T05:54:19.190650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.917697Z","title":"and Waibel, A","venue":null,"work_id":"116d228d-cd18-4459-b6bf-dcec679bdb22","year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.675023Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:9576eb3ce6512f154859df0258e68a0d9c583a049b2f9362f76d4dd00f248763","observation_id":"8fe11650-a364-41f5-bac3-25ff1735f9b3","resolution":{"observed_at":"2026-08-09T05:54:19.922188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.679338Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.679338Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:20784b2bd4265ace389da8fecaee8e370ab15c37c7928d57ea905e95dff3e8e7","observation_id":"e474235b-a6d9-48c8-9a29-0a95687b954b","resolution":{"observed_at":"2026-08-09T05:54:18.679338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09452","last_updated":"2017-06-09T11:34:06Z","snapshot_observed_at":"2026-08-03T16:11:03.130454Z","submitted_at":"2017-03-28T08:39:06Z","title":"SEGAN: Speech Enhancement Generative Adversarial Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09452","snapshot_observed_at":"2026-08-09T05:54:18.683587Z","title":"Segan: Speech enhancement generative adversarial network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.683587Z"},"links":{"cited_paper":"/paper/1703.09452","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:4c3f5847bfcaea70b4e8727ea2db78f558065f1f8ade43f4d8c52836c5080a79","observation_id":"646efddb-8507-47f0-85e5-4bec0e3bd88d","resolution":{"observed_at":"2026-08-09T05:54:18.683587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16973","last_updated":"2024-06-14T00:29:46Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:38:32Z","title":"VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16973","snapshot_observed_at":"2026-08-09T05:54:18.688104Z","title":"Voicecraft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.688104Z"},"links":{"cited_paper":"/paper/2403.16973","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:cf2e616fc5273bd20e60b25372fa22a78a8cb2e19a831e2e8af93c2a1a604546","observation_id":"2b862f44-ab43-4145-833d-738fbad9bb76","resolution":{"observed_at":"2026-08-09T05:54:18.688104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-09T05:54:18.692824Z","title":"Mls: A large-scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.692824Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ade637dee90db278fba3bd9977bcabe18b110d11d161194a0789383e97eeba5d","observation_id":"c8c8aa96-a383-4fc9-8102-2622bbb8e64d","resolution":{"observed_at":"2026-08-09T05:54:18.692824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.894250Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss","venue":null,"work_id":"d6e8f457-8e81-4171-83fe-4f1388d6252f","year":2019},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.697103Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:c1db0ee5b4773608c803a7c7cb9645b0788edfbdb2252a86919431eb449e7f93","observation_id":"5ab8c129-6bf2-48bb-bc43-804503660c70","resolution":{"observed_at":"2026-08-09T05:54:19.899303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-05T11:33:26.486472Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-08-09T05:54:18.701474Z","title":"Openvoice: Versatile instant voice cloning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.701474Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:99e483daf40736600241163d804ef1db610eb6169861ba6a79f337e9a94d7757","observation_id":"d82cf2df-1836-4b1e-b2e7-87646d61f838","resolution":{"observed_at":"2026-08-09T05:54:18.701474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.705838Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.705838Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:5924539cc69af3e1f5030cfd875d7d06c23f9aad73adf34a95006091e3756ec2","observation_id":"8a6d39fa-513f-49d6-97d8-0004b35f4d2b","resolution":{"observed_at":"2026-08-09T05:54:18.705838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.709976Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.709976Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:3fac83da72e3a7fc2b7a9da38bc0eea7ecf3f8854771662927503c8480e0bace","observation_id":"785e26aa-b645-468d-b18b-168d408cd971","resolution":{"observed_at":"2026-08-09T05:54:18.709976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.862452Z","title":"K., Gopal, V., and Cutler, R","venue":null,"work_id":"8464f0b4-2f9a-4e59-9833-1fe9b3ace8cd","year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.714080Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:bb9f74c3540ad4aa0b69db0e4196bda4443e1a7c3ce1901d5d689a543d780450","observation_id":"4ff9627c-32c5-4e6e-b5ca-7bfa5483616f","resolution":{"observed_at":"2026-08-09T05:54:19.866997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.846820Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":"db4a8fab-eb59-4990-9833-9026f2f13e97","year":2019},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.718356Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:20e4f9ac55cefec6dd9c3d2673c9ce5624f7053653ef9a3f7af07c12a791e11f","observation_id":"fafeeac0-60a1-4cd0-b55a-60900ba645e5","resolution":{"observed_at":"2026-08-09T05:54:19.851663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-09T05:54:18.722514Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.722514Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:7ebb88e87495c8d6b364c5753746487e0f8ac58469448f1846dd6a29901e0c9e","observation_id":"cfe4fe30-e4b7-4e03-be0a-e17f861970d9","resolution":{"observed_at":"2026-08-09T05:54:18.722514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-09T05:54:18.726951Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.726951Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:f9ce180826aa6766926a62b3a5a78136adf0d324bb21beb8028b98472e9a2bc7","observation_id":"6315151a-bfd4-449a-b68c-b0427656b917","resolution":{"observed_at":"2026-08-09T05:54:18.726951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-08T02:04:12.090464Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-09T05:54:18.731349Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.731349Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:34b3248410ebf8d0ee25d49b881528f4bd4ae03bbac4da69d8bfc905b977c110","observation_id":"7d5ca28d-17ae-426b-a5b3-3936b1de4e81","resolution":{"observed_at":"2026-08-09T05:54:18.731349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07841","last_updated":"2024-09-17T01:41:32Z","snapshot_observed_at":"2026-07-06T19:14:12.404382Z","submitted_at":"2024-09-12T08:41:07Z","title":"TSELM: Target Speaker Extraction using Discrete Tokens and Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07841","snapshot_observed_at":"2026-08-09T05:54:18.735975Z","title":"Tselm: Target speaker extraction using discrete tokens and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.735975Z"},"links":{"cited_paper":"/paper/2409.07841","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ed43c660a5cd4900fdd6a0be1c353cb4379128cacbe4b5943759c90337fb8563","observation_id":"ae922d9d-19b8-4f8b-bc0e-12295ace2f4f","resolution":{"observed_at":"2026-08-09T05:54:18.735975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.740373Z","title":"The diverse environments multi-channel acoustic noise database (demand): A database of multichannel environmental noise recordings","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.740373Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:511362901cfe345300e766e0ee99793dcca7f62c4c858bf1a5579aff1d2d4b94","observation_id":"491cae55-699b-4b4c-8fac-bd585b4a2d6b","resolution":{"observed_at":"2026-08-09T05:54:18.740373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T05:54:18.744660Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.744660Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:07fe5458eb4e3953c6adc7d4dbf106ce8f627732c9a888bfd85189de068c7a7c","observation_id":"fd0efa9e-8430-4bf0-97ec-4797e7591bbf","resolution":{"observed_at":"2026-08-09T05:54:18.744660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.749227Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.749227Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:99c3c89e7eb4e4423b54d2e15aec0f1d80c1771d0d9c31df6df3e2487ec8c5b0","observation_id":"960b469c-553f-4d20-98e6-7ecb07302aac","resolution":{"observed_at":"2026-08-09T05:54:18.749227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.753297Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.753297Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:cb02ab3abdc26410272d119d5436a33a64471df7ce678097bcc9a0735bbf0824","observation_id":"83537652-d13a-446b-bc96-a0070a2c828d","resolution":{"observed_at":"2026-08-09T05:54:18.753297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.803762Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit","venue":null,"work_id":"7b5ce1af-08a6-4d29-bd52-7b33f560e719","year":2017},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.757666Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:a3601e17eadd800fd04b50d1e26bb871ed7d26e9acffa318860983602c2585a3","observation_id":"d34be66d-e229-47ff-a52c-457d02c9aa2c","resolution":{"observed_at":"2026-08-09T05:54:19.808818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T05:54:18.761884Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.761884Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:971533c7f63cb447c72c95e8843c0cade35ebceae993d680b201b153b89cb324","observation_id":"163393c2-c867-4746-b125-fe627ac4467d","resolution":{"observed_at":"2026-08-09T05:54:18.761884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-09T05:54:18.766328Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.766328Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ec32c4888e879b9484400fe06a503d1c5995fe98b2ffc07aa52b3ceed07d03ce","observation_id":"b44d84d4-925a-4bfe-9cde-451247cfef80","resolution":{"observed_at":"2026-08-09T05:54:18.766328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04826","last_updated":"2019-06-19T17:10:51Z","snapshot_observed_at":"2026-08-02T02:00:03.822386Z","submitted_at":"2018-10-11T02:57:14Z","title":"VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04826","snapshot_observed_at":"2026-08-09T05:54:18.770915Z","title":"A., Weiss, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.770915Z"},"links":{"cited_paper":"/paper/1810.04826","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:ae4546b973813302d24ee10448a7e22f7f86331335008071738384eb3de949d6","observation_id":"387d996f-4d08-4dcf-861a-6178b55bc93d","resolution":{"observed_at":"2026-08-09T05:54:18.770915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15799","last_updated":"2024-09-24T06:47:12Z","snapshot_observed_at":"2026-08-04T16:20:42.322464Z","submitted_at":"2024-09-24T06:47:12Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15799","snapshot_observed_at":"2026-08-09T05:54:18.775414Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.775414Z"},"links":{"cited_paper":"/paper/2409.15799","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:cf6f51849b193612c64a4cd26875afa88eee3206462f6dd63ace1372b0876311","observation_id":"d96c1a35-2d2e-476a-9f0b-dc1474778e8c","resolution":{"observed_at":"2026-08-09T05:54:18.775414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.789249Z","title":"E., Chen, S., Tang, M., Liu, S., Li, J., and Yoshioka, T","venue":null,"work_id":"05ca5249-b0ed-4226-a65b-5a28076df94b","year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.779739Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:693cfdfbc3e231f2628fffe3662c81e0ac427a5531b787468d44c83727d9dd36","observation_id":"c7e51422-5846-4ab5-a9af-00b0ac99a83f","resolution":{"observed_at":"2026-08-09T05:54:19.793957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-09T05:54:18.783977Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.783977Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:c811761635ec84b4f44bfe3e0051a960ea59465a801906807d6258f1d216862e","observation_id":"f4d8a91e-e789-4371-b7d5-103e43f7811c","resolution":{"observed_at":"2026-08-09T05:54:18.783977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.774739Z","title":"Lm-vc: Zero-shot voice conversion via speech generation based on language models","venue":null,"work_id":"ecd34d77-ad0d-45d1-9090-b5e8540203c5","year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.788526Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:321750bfbe01c401687aa0ece7fd23cf65608fd53e64eaa3da5a9c3ca119697b","observation_id":"2f7cd87c-be18-42aa-a4cf-c96eed0bddec","resolution":{"observed_at":"2026-08-09T05:54:19.779298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.759429Z","title":"Selm: Speech enhancement using discrete tokens and language models","venue":null,"work_id":"84c24ddf-1362-4e33-8ff0-da05f50471bc","year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.792763Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:1b2e51313a330f9ca96d90e1e36034661fdc35cf0ea6695430815bd1a8b82178","observation_id":"a95679b0-4c62-457f-bd4d-1bd5ed94b882","resolution":{"observed_at":"2026-08-09T05:54:19.764011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:19.744688Z","title":"Tf-gridnet: Integrating full-and sub-band modeling for speech separation","venue":null,"work_id":"36662a5e-098e-47f1-8651-9f299125e613","year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.796775Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:d88e843b267519517187bddf56823bdc2b44d2d4ce71ae0ed700039e7896c02a","observation_id":"273d08e5-d991-4608-a813-f5c7d9dd72f2","resolution":{"observed_at":"2026-08-09T05:54:19.749522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01160","last_updated":"2019-07-02T04:27:55Z","snapshot_observed_at":"2026-07-06T08:04:17.909965Z","submitted_at":"2019-07-02T04:27:55Z","title":"WHAM!: Extending Speech Separation to Noisy Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01160","snapshot_observed_at":"2026-08-09T05:54:18.801094Z","title":"R., McQuinn, E., Crow, D., Manilow, E., and Roux, J","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.801094Z"},"links":{"cited_paper":"/paper/1907.01160","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:69bd531b4aa8b6940daa82ef115a42cf1ec0ca2b323dbe870d65476dbde97e87","observation_id":"82ca947b-6ee3-4c70-bb17-d2c49b3a1a0b","resolution":{"observed_at":"2026-08-09T05:54:18.801094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-09T05:54:18.805912Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.805912Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:bed9eded786710bc556f3fa307a15c6714c1cc19e6529036007b1122df01cb27","observation_id":"487492ea-0bfc-4fc3-974b-06fc15d72545","resolution":{"observed_at":"2026-08-09T05:54:18.805912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-09T05:54:18.810390Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.810390Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:83a19431f7feca69f9e9e373815d7e7b35261e0c678c81ab500a73a6bb2bb8b4","observation_id":"a78a21a8-abbf-4ac3-9259-c77b9d0d1bf3","resolution":{"observed_at":"2026-08-09T05:54:18.810390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:18.815060Z","title":"G., Yang, M.-H., Hao, Y., Essa, I., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.815060Z"},"links":{"citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:7b965de00a53b790ee50057cbec8119d09dada10f2c126cbee994019bcfeb42b","observation_id":"d54158eb-a70f-4b1b-8d1a-3de6e8727181","resolution":{"observed_at":"2026-08-09T05:54:18.815060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-09T05:54:18.819238Z","title":"B., Versari, L., Sohn, K., Minnen, D., Cheng, Y., Gupta, A., Gu, X., Hauptmann, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.819238Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:8529aad9086e288e46d1bb8e224dfa2aeb879ac441dde59ed343dbadfddf30c3","observation_id":"75875b51-e68a-4244-8ca0-e4b82c4592d3","resolution":{"observed_at":"2026-08-09T05:54:18.819238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 7 inbound Pith citation observations for arXiv:2502.03128."}