{"as_of":"2026-08-11T19:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:113db896f91d7a23f9daaaa767d2e8106005802494ddce87ba8ed962f4c16ccf","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:15.195399Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.05332/citation-record","integrity":"/paper/2501.05332/integrity","json":"/paper/2501.05332/citation-record.json","paper":"/paper/2501.05332"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:16.050188Z","title":null,"venue":null,"work_id":"36ce39d9-a964-4d0c-8e73-d2f802e5a752","year":1976},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.921168Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:77ef321614809e72da1ef70d91f3740fabe51f69ce63821c487c09ebbf087b88","observation_id":"78316f17-55a2-4429-872a-b6473ab948d5","resolution":{"observed_at":"2026-08-10T21:18:16.056272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:16.034334Z","title":"Speech analysis/synthesis based on a sinusoidal representation,","venue":null,"work_id":"cad04f1d-bc59-40f3-82e0-4aee4d362237","year":1986},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.927861Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:68f776bd507678140ee6c5a3efc5d9c09d2711a19a67f4b96231ab0f143bff88","observation_id":"cf939511-44de-4644-af16-085bce42c0ac","resolution":{"observed_at":"2026-08-10T21:18:16.039414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:16.014998Z","title":"Speech analysis/synthesis and modifica- tion using an analysis-by-synthesis/overlap-add sinusoidal model,","venue":null,"work_id":"90dc5332-c17d-44ba-847c-1465dbff4033","year":1997},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.933873Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:bba7491474dba8d6f469710c8ed24ff738f92d353d5af828f6f654d825288fb0","observation_id":"c97c97b4-7d2d-4cca-8193-6c69c27c2290","resolution":{"observed_at":"2026-08-10T21:18:16.021198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.991041Z","title":"Spectral modeling synthesis: A sound analy- sis/synthesis system based on a deterministic plus stochastic decomposi- tion,","venue":null,"work_id":"29278d71-245d-46a3-bf97-e39a8d7144cc","year":1990},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.939389Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:539e67f948cdd36b6de1a3c847d811316feec7b2ebdb06e87f0e353cf7cf5c58","observation_id":"8a77f054-5119-4a95-a723-b81134781679","resolution":{"observed_at":"2026-08-10T21:18:16.001357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.971497Z","title":"HNS: Speech modification based on a harmonic + noise model,","venue":null,"work_id":"096b47c3-a5b7-4e39-bcaa-7a24234c8dd5","year":1993},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.945301Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:3725a9a3b3686cff65b9aa973fab6daae1c347f9057eb80ebac591cfe4beb325","observation_id":"ab84d7e6-ad06-4345-87f5-2bb589433605","resolution":{"observed_at":"2026-08-10T21:18:15.977931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.950841Z","title":"Analysis/synthesis and modification of the speech aperiodic component,","venue":null,"work_id":"aced3320-d4ec-41c0-a950-c5ff03c46c64","year":1996},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.950661Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:d8c8d9ccd3ee2acbb0572e3d1ddb7e52436403a9897c2116b746a65e59d4fb62","observation_id":"188a3b83-9118-433d-a814-fc430dc3649b","resolution":{"observed_at":"2026-08-10T21:18:15.957651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.924401Z","title":"Pitch-synchronous waveform processing techniques for text-to-speech synthesis using diphones,","venue":null,"work_id":"da4a2d3f-4ed2-4f7a-adc2-49bfb9538fb0","year":1990},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.956552Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:3339a38507ad3d7396a9e57b1693e8e2b07af1e0c252b75729de727ee9ae08db","observation_id":"9455ab30-511c-45e4-9d69-20246d1ccfd7","resolution":{"observed_at":"2026-08-10T21:18:15.937209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.905552Z","title":"Improved phase vocoder time-scale modi- fication of audio,","venue":null,"work_id":"257fdb7f-453d-41b0-ac18-702b2b386fa6","year":1999},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.961508Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:157d51e65abb362d3ceb486efbda0e3f04ea282a15a4632ca1fd7f052b3a6a10","observation_id":"e7f06493-4983-4df9-bd53-89ec86b944a3","resolution":{"observed_at":"2026-08-10T21:18:15.911352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.887956Z","title":"STRAIGHT, exploitation of the other aspect of VOCODER: Perceptually isomorphic decomposition of speech sounds,","venue":null,"work_id":"13cba154-98c4-4180-bb1e-a63a95cbfcc8","year":2006},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.966599Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:2b0bd0cd781a8e06ab3bb9c81a172896e25450e477d7a366cf8dfcee77dc9446","observation_id":"e74256c8-99bb-49da-89e2-0240c9d9bdda","resolution":{"observed_at":"2026-08-10T21:18:15.893689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.867868Z","title":"World: a vocoder-based high- quality speech synthesis system for real-time applications,","venue":null,"work_id":"c8cf566d-7bf7-4d03-a1d9-0855e467436e","year":2016},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.971913Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:5d0c3c08569852706e1ce29c84e3f27850a3d3d64255ec1d6368918c6c192b96","observation_id":"09759bbd-2886-4718-be68-de420a8b5dc9","resolution":{"observed_at":"2026-08-10T21:18:15.874649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.847743Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"ce139b5a-0b93-4c71-a8af-143cd28842c4","year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.976248Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:aa39d7349dc0278567771429ed6ca9de3b39726b7df96508fb4ed5d1c563a884","observation_id":"ef9f6a6b-fccc-4a3c-a941-b8d69dc941d3","resolution":{"observed_at":"2026-08-10T21:18:15.854015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:14.980882Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.980882Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:7c8491ff8bc7a708cb04534f36e8292ceb4f9236e025070ac1c79dda5b082aec","observation_id":"cbeca490-e130-432e-89c3-f35dc3aa61a0","resolution":{"observed_at":"2026-08-10T21:18:14.980882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.815771Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"2fa7f608-2a88-439c-ad7e-7fdb21a19ad6","year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.985768Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:01fa75b9e41f010a20e5f468444ef5704b64aa3becb7b4bdc36513bfbba9fa84","observation_id":"caa1de04-6e11-47e2-a2ca-af8b7e9b465e","resolution":{"observed_at":"2026-08-10T21:18:15.822520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-09T13:24:51.366298Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-10T21:18:14.990854Z","title":"Speech resynthesis from discrete disentangled self-supervised representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.990854Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:daa7efe1036461e650147decaef5b8f18650d2a0b4729a063e22129e16db0c45","observation_id":"c9521e5c-be4e-42b5-b8a2-e72bb11f31ff","resolution":{"observed_at":"2026-08-10T21:18:14.990854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.798064Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"8b816fc1-b7d6-49ec-bf78-f8c5e8d0684f","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.997002Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:909295e5a6e812ed1b64bb0bfc30b0c24d928666d87b8a677bd99d6a1b2c8685","observation_id":"87ea4ccf-987b-4777-9fd3-b96796e9e6a6","resolution":{"observed_at":"2026-08-10T21:18:15.803457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.780728Z","title":"Hifi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"df6686cf-91ce-47bf-b0c2-c89d98ea68df","year":2020},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.011918Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:842cf017abf0ea9487b1b0696675187cf38f528fbf12a3dccdaf5e09c9d9028a","observation_id":"cfa6c315-f0c5-4f3c-ad6b-037b4117194d","resolution":{"observed_at":"2026-08-10T21:18:15.786693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.757937Z","title":"CREPE: A convolutional representation for pitch estimation,","venue":null,"work_id":"7f22a4f2-49e3-471f-aeea-84107d63589c","year":2018},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.020133Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:af6d413cad5ef8badac0cdd5466ca9ae98abc915f8a610e5fa4667bd89c5877e","observation_id":"764b5b8e-019d-448b-b4a8-547843a84ddd","resolution":{"observed_at":"2026-08-10T21:18:15.763028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-10T21:18:15.025829Z","title":"Ecapa-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.025829Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:3b9ac2a15032cd3f5cb957aebf002aeb679b949f5951b87caa3d651bad6763cc","observation_id":"f2252bfe-383e-4dcd-8ce8-a514fd94867f","resolution":{"observed_at":"2026-08-10T21:18:15.025829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.742281Z","title":"Brouhaha: Multi- task training for voice activity detection, speech-to-noise ratio, and c50 room acoustics estimation,","venue":null,"work_id":"4cc8945f-31e3-4d93-ab7e-71103e6d719f","year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.032234Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:98031d877f7cfc07f6243e9e00f2fc2a9382a1f660c2176ab20ead6448c79b72","observation_id":"be57210f-98ea-44cc-8da8-2b47308fb7bc","resolution":{"observed_at":"2026-08-10T21:18:15.747351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.726359Z","title":"Neural discrete representation learning,","venue":null,"work_id":"b6d57eb2-3cdd-412d-955a-47476525e5c0","year":2017},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.039976Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:e1883215afe132dbe16eb016432ad5ba860cb3d7357fbee658cb2bde60f862cc","observation_id":"cd3d3ccd-d69f-42f2-86e1-a075dd9b3454","resolution":{"observed_at":"2026-08-10T21:18:15.731382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03568","last_updated":"2025-05-09T08:19:45Z","snapshot_observed_at":"2026-07-06T15:23:49.202914Z","submitted_at":"2023-05-05T14:19:46Z","title":"A vector quantized masked autoencoder for audiovisual speech emotion recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03568","snapshot_observed_at":"2026-08-10T21:18:15.048903Z","title":"A vector quantized masked autoencoder for audiovisual speech emotion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.048903Z"},"links":{"cited_paper":"/paper/2305.03568","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:ae1ac61536ebeb3201e3d8c0e4d0679130aa0bccc7d43d860ea6da99dc2a641d","observation_id":"0131dad0-d0cc-41a3-9ce5-e2bf3e9f6390","resolution":{"observed_at":"2026-08-10T21:18:15.048903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.709265Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"4613e77e-11e6-4572-8c16-702adb854ab2","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.055931Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:f4d6d2d0008a6211cba43d48f4da5ecf1ddcdc41f7bacc84a6c8821e5bdaa4bb","observation_id":"5b12b587-a5e6-4c31-a7e9-00eead8f41b0","resolution":{"observed_at":"2026-08-10T21:18:15.715030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.692173Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"3851a5e3-fdcb-4550-a255-60ce3ef5f27a","year":2020},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.061930Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:40f1096c47cc992bd7b667f119bd83d69c19e67da39dfe3fbc59adfa87f1806f","observation_id":"9c9d8261-2a90-4ef7-9df1-48e127b2fe7b","resolution":{"observed_at":"2026-08-10T21:18:15.697722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.677087Z","title":"Attention is all you need,","venue":null,"work_id":"6b24ad26-d816-48d7-8eaf-7c37a5e10a4b","year":2017},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.069225Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:7527b107644f61a38d644cf698377ab9060f2dc73d2e1d6532873655d8dbd819","observation_id":"3c0d0dc3-acb0-4387-a660-9bafcd021556","resolution":{"observed_at":"2026-08-10T21:18:15.682108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.00264","last_updated":"2020-09-23T03:16:28Z","snapshot_observed_at":"2026-08-09T03:24:29.943798Z","submitted_at":"2020-08-01T13:42:29Z","title":"DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.00264","snapshot_observed_at":"2026-08-10T21:18:15.078041Z","title":"DCCRN: Deep complex convolution recurrent network for phase-aware speech enhancement,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.078041Z"},"links":{"cited_paper":"/paper/2008.00264","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:7a4f344789852a028775d9f27ea813fb453bb853fc5dfbb616e1776dbf5954bd","observation_id":"ead23dc7-9872-488e-bf7f-f032c23489c4","resolution":{"observed_at":"2026-08-10T21:18:15.078041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.661015Z","title":"Phase- aware speech enhancement with deep complex U-net,","venue":null,"work_id":"d01fe1f7-8e7a-4d65-af78-b5941fb77719","year":2018},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.084578Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:04f97b37f1fc2a3f160053f287377ea2318403f67d7ce3d3dcc9ef52990e4708","observation_id":"512054d5-6ed5-4586-83dc-012f29817b1a","resolution":{"observed_at":"2026-08-10T21:18:15.666451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13975","last_updated":"2020-08-14T10:52:10Z","snapshot_observed_at":"2026-08-11T12:55:43.645990Z","submitted_at":"2020-07-28T03:51:28Z","title":"Dual-Path Transformer Network: Direct Context-Aware Modeling for End-to-End Monaural Speech Separation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.13975","snapshot_observed_at":"2026-08-10T21:18:15.089856Z","title":"Dual-path transformer network: Direct context-aware modeling for end-to-end monaural speech separation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.089856Z"},"links":{"cited_paper":"/paper/2007.13975","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:2f7af7144416cd75a1b3743fe94a3ac2cf0f697d4b9a8e8a038e1c605062338b","observation_id":"0de9e15e-57ae-4738-aec3-aba81e331c3c","resolution":{"observed_at":"2026-08-10T21:18:15.089856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.643372Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":"f7deb4ae-d0ae-4904-a740-06d564e5baf8","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.095540Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:ebf07d844aaf7012ad8fafeb07d5c383d23218e1820f10ecdf13afca3e0e2b27","observation_id":"c94154bf-a919-4a22-848b-827755ed68b3","resolution":{"observed_at":"2026-08-10T21:18:15.649768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.626620Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"9947d80f-53c8-4325-889d-dbb7cb96babf","year":2015},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.101155Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:a8cc8c0c7a1ef617735c1d7a27f331c6bcd5d72e923d404c65a7ba329f8cb0eb","observation_id":"a1c9c67c-0775-47b4-b998-8cc8c4419e08","resolution":{"observed_at":"2026-08-10T21:18:15.632143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.610954Z","title":"DEMAND: a collection of multi- channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":"d1e18c34-7a2b-4677-b823-b3299ff95406","year":2013},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.106247Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:e3ec68a003b718292e5dc557f9b141a838685bb1cdb8d58626e2503a2e5884db","observation_id":"1b54d229-4a4f-46f9-8fd5-7a8766f7cacc","resolution":{"observed_at":"2026-08-10T21:18:15.616365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.110816Z","title":"Pedalboard,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.110816Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:8f87f6ac2e886f30d713e1d95e00587e41d19183ddebe6baeef40599ccd5a9d9","observation_id":"fecfb541-5dc9-4496-b178-08330e6a079a","resolution":{"observed_at":"2026-08-10T21:18:15.110816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-10T10:54:26.224254Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T21:18:15.115417Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.115417Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:87d3d4133c87605571ccfd27a70ad0ab35b0ab029654bdd42b418e93f8ece83b","observation_id":"2f270ae9-7702-4761-bae5-017a66649232","resolution":{"observed_at":"2026-08-10T21:18:15.115417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.592924Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":"7495c2df-8459-4144-85df-ea1d60d657b1","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.120486Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:60b4f5b69d850a18852224df0bf5dace938e514a037b22a7a04747dd4799f49f","observation_id":"a8e88527-72e1-4c09-890a-5cc3a0765c84","resolution":{"observed_at":"2026-08-10T21:18:15.599067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T21:18:15.129971Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.129971Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:892aad23adadfc6e55859a33e7c6f067b98abb59e554d9a6ce77ea1f5efde9db","observation_id":"d47231e4-35b9-4781-a762-26a42955d8a6","resolution":{"observed_at":"2026-08-10T21:18:15.129971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.576910Z","title":"SDR–half-baked or well done?","venue":null,"work_id":"977ef93a-3979-4173-88ea-73644e1c9281","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.136261Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:b72288f8209261f6ad293da51d7889cde3a254622a655de558ede792f9e29280","observation_id":"2f8f3491-dbb2-4707-a545-67bf629a53cd","resolution":{"observed_at":"2026-08-10T21:18:15.581834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.561098Z","title":"Perceptual evaluation of speech quality (PESQ) – a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"318b9b26-af3a-4c33-9051-c7790bad4ff7","year":2001},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.142181Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:cfd208dae70cea87974b20f9bc8ec6911d6736352df42b613c083a141aa786a4","observation_id":"3b48262a-ffeb-4c02-bfa6-c10ab9d26b63","resolution":{"observed_at":"2026-08-10T21:18:15.566373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.545789Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"da227df8-df5d-40b5-83a1-c876b29bd532","year":2011},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.147179Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:a3b1ea0aa9c0edd77a9519592f2e9a5c7321c6cafb30ee7515e755bad7eee5b5","observation_id":"8b20d736-d8d6-40eb-b500-868462a92682","resolution":{"observed_at":"2026-08-10T21:18:15.550740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.529051Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"ab37f24b-2eb8-42d0-a6a2-aa883061a7ea","year":2018},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.152200Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:043c745efc75ae56138ec6a1bcd470d352176b19add8da23bb8b82326b61530e","observation_id":"d7e7dd40-04d7-4d69-a8f0-bca3b4530130","resolution":{"observed_at":"2026-08-10T21:18:15.534553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.511714Z","title":"Speech quality assessment through MOS using non-matching references,","venue":null,"work_id":"9cf705f1-0b2a-4925-950c-067074e28f80","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.157220Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:789357338e965f0572bc2773c2eca1ec2b03062b5c33df38501d5beb3adecb4b","observation_id":"45192b41-6934-44e2-8e63-2e92347c00bb","resolution":{"observed_at":"2026-08-10T21:18:15.517122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.495024Z","title":"Torchaudio-Squim: Reference-less speech quality and intelligibility measures in Torchaudio,","venue":null,"work_id":"2db47fab-991d-4429-aa1b-d40e4092118a","year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.162432Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:182013296b98d8d28195f2b72be557d3adf50aa27c773a7c7285973ccaa67cfb","observation_id":"1f76d720-2f26-40d7-9d5d-f9e853a80288","resolution":{"observed_at":"2026-08-10T21:18:15.500396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.477237Z","title":"DNSMOS P.835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"4082f7f7-1b00-4573-8f5e-f8c48c312311","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.167258Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:a82cddcf3a41a193abceef21be37c01fbe799e3303f56b859330df04cd752c9c","observation_id":"ce955239-e364-4fda-991a-f0bf358e0c7a","resolution":{"observed_at":"2026-08-10T21:18:15.482873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.459074Z","title":"A pitch tracking corpus with evaluation on multipitch tracking scenario,","venue":null,"work_id":"1e268549-6024-4880-8678-f5443d182f0b","year":2011},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.172809Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:132df7a5cee2198383d1660a36c2bfa448daa2c55a09a17c56bf67d641b20381","observation_id":"7ed81e39-7248-4c77-a725-851eead3c682","resolution":{"observed_at":"2026-08-10T21:18:15.465591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.440022Z","title":"pYIN: A fundamental frequency estimator using probabilistic threshold distributions,","venue":null,"work_id":"4c88a0a4-698a-4a8b-a679-eacc7b119eb7","year":2014},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.178371Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:04bd36bd383c23ee21ae90143bca0d4d002e28b32aae8242f403bbd555ad426b","observation_id":"5b793503-8cbb-4b0c-8407-9945181c9317","resolution":{"observed_at":"2026-08-10T21:18:15.445626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.184183Z","title":"A sawtooth waveform inspired pitch estimator for speech and music,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.184183Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:ed874a9c0240673610642b00ccfb01ed5bd92b57b44a4e960dea99ef918aacfd","observation_id":"e31f8484-8a53-46c8-b473-90725fca49ec","resolution":{"observed_at":"2026-08-10T21:18:15.184183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.407059Z","title":"Revise: Self- supervised speech resynthesis with visual input for universal and generalized speech regeneration,","venue":null,"work_id":"ab577697-06d8-4a0b-8b5a-a1d85254bb30","year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.190587Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:e8ce9c67283649a2cbc32f26cfd429e38fbe38da8ea5f75b4525da6b09b554dd","observation_id":"3016e0d9-78bb-43c2-b5bf-7450912cd148","resolution":{"observed_at":"2026-08-10T21:18:15.412512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.388357Z","title":"Generating diverse high- fidelity images with VQ-V AE-2,","venue":null,"work_id":"7ca6e88f-dfc3-4a96-878a-336b75c75343","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.195399Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:8c7fdd43d920f1a93d1367cab80bbef53092162fa4cd7605d36b5d36318b4f53","observation_id":"6cda7d60-be83-49b5-84b9-70df58dceec9","resolution":{"observed_at":"2026-08-10T21:18:15.395111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T15:56:53.524011Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2501.05332."}