{"as_of":"2026-08-18T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a706b6aa88675ea1a79f32ac069056baee6a2d1bf9ca08bd735ec0516d1e37e2","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:41:25.045627Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:45:11.099531Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12825","snapshot_observed_at":"2026-08-02T20:45:11.099531Z","title":"Autoregres- sive speech enhancement via acoustic tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22417","last_updated":"2026-06-04T10:49:29Z","snapshot_observed_at":"2026-08-13T23:11:02.667333Z","submitted_at":"2026-02-25T21:22:08Z","title":"Absorbing Discrete Diffusion for Speech Enhancement","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:45:11.099531Z"},"links":{"cited_paper":"/paper/2507.12825","citing_paper":"/paper/2602.22417"},"observation_digest":"sha256:b53a974619c9f6d512522b9195f07a3e375e61b31665dfc7f881c5bc451b7a2c","observation_id":"99f1c4fc-b32d-42bc-8a36-6960e5ecc296","resolution":{"observed_at":"2026-08-02T20:45:11.099531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12825/citation-record","integrity":"/paper/2507.12825/integrity","json":"/paper/2507.12825/citation-record.json","paper":"/paper/2507.12825"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:32.112495Z","title":"MetricGAN-U: Unsupervised speech enhancement / dereverberation based only on noisy / reverberated speech,","venue":null,"work_id":"c3654d0b-d132-4f5a-95ec-7f77416f42a5","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.393607Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a40cd6fa78596bfd2cde061290f0102e050c85d3b8768db0ce5875efe014999c","observation_id":"3df6dd21-9582-46bf-91f6-9737edb1dd06","resolution":{"observed_at":"2026-08-06T16:41:32.193083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.795018Z","title":"MetricGAN: Generative adversarial networks based black-box metric scores optimization for speech enhancement,","venue":null,"work_id":"b385c193-55da-4985-80cf-db628e5eabdc","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.398740Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:07456316b070318388e4e10b76443f3acf564fb5d4fd0fb34e9911fdd75e60e5","observation_id":"ee931f9a-7cf5-40a5-aae5-9fafa6a6534b","resolution":{"observed_at":"2026-08-06T16:41:31.979967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.617635Z","title":"MetricGAN+: An improved version of MetricGAN for speech enhancement,","venue":null,"work_id":"a20e8214-552d-41f7-80a0-2e3c265dcff5","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.401797Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5d06b689bd76d8d71c382e5031a20ed1e2f74b3913d8ebf673672f126c0ee598","observation_id":"005efad6-f48e-4d49-9b48-891d41d0a537","resolution":{"observed_at":"2026-08-06T16:41:31.700241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.500558Z","title":"Reinforcement learning based speech enhancement for robust speech recognition,","venue":null,"work_id":"989d40a9-a8e3-4472-9f6c-852e63cb87fb","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.541441Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:c5875a6bb95f1a4b3ecb397e04f4427815dedf4d9a20bc30e71b6c394c46d843","observation_id":"60630760-ea59-47eb-9775-ffe6c04d6464","resolution":{"observed_at":"2026-08-06T16:41:31.564883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.330627Z","title":"MetaRL-SE: a few-shot speech enhancement method based on meta-reinforcement learning,","venue":null,"work_id":"6e211d39-b20f-4f4f-ae65-15f11d9bc8bf","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.626694Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2cf97f0d7276a87f0828d2432a0c7b34165eb3deb2d386d4eb08762740a3eaba","observation_id":"7db48736-4f7e-4eb3-a339-8ae2c857983a","resolution":{"observed_at":"2026-08-06T16:41:31.428773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.158085Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"188eb2dd-cd17-4094-8fc8-0d15037fb074","year":2001},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.717389Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:457a1a2e16d1b3ee285cf9436d1912387a3c9fd36e8432efbcc5b2560915f9ab","observation_id":"4a0c77a7-5317-4dba-a4b9-4d7921ce76c8","resolution":{"observed_at":"2026-08-06T16:41:31.202572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.033040Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"dbacd381-742a-479b-b147-19e681930e79","year":2011},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.785033Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:de568b639f5f3d8918cea762af41a0b82a992380f75983e317011b2c6c8ca030","observation_id":"1ea95bef-9ff6-4e26-8b0f-5a5f0968521e","resolution":{"observed_at":"2026-08-06T16:41:31.092612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.923445Z","title":"Conv-TasNet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":"bfa0b847-3fd8-4616-a022-aed13d24a55a","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.881954Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:e03ec0cfff88ea936c1c6ea28776df639c75df1679eb3db3a4d2d155d1885ae5","observation_id":"813ca669-e79a-4edc-97a6-2eb96bcc5fda","resolution":{"observed_at":"2026-08-06T16:41:30.990140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.779297Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"deddf372-f851-491d-90e2-7d7d23a59715","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.916913Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:c2e5be746d4657381812016a0910d74529f04dd950d80c0360b65060f972d50e","observation_id":"9b536600-b151-42c1-a9b7-737dea7d705a","resolution":{"observed_at":"2026-08-06T16:41:30.872986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.620210Z","title":"Real time speech enhancement in the waveform domain,","venue":null,"work_id":"4476d170-edd8-4ce7-9db0-eb635872f013","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.996481Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:b1fcf1ee9f3a126e4d1056a1d162ae5629f9cf3903870985abf417dd8aeccd88","observation_id":"fd7b1bf2-56d2-4d9a-a123-c6c596f8e5e7","resolution":{"observed_at":"2026-08-06T16:41:30.679297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.491786Z","title":"DNN-based enhancement of noisy and reverberant speech,","venue":null,"work_id":"cdcc6ba5-f671-4410-883c-7531060ffa5c","year":2016},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.096292Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a0e3e0549d852f5d1cc3ce221932f693376c2e5840c656999bac05661e6fd468","observation_id":"6489b662-1f5b-419b-9a0a-55a0e55e6e5a","resolution":{"observed_at":"2026-08-06T16:41:30.562523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.341654Z","title":"Phasen: A phase-and-harmonics-aware speech enhancement network,","venue":null,"work_id":"6f519858-2dbf-48d3-b5e9-beb1da453690","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.162198Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:c810e627af3dc54f07a657ab50fba25cda9349ca0b220807ac05a4c16b8e6921","observation_id":"1beafc15-0309-417f-b6da-3ad0d9dc3d3b","resolution":{"observed_at":"2026-08-06T16:41:30.416171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.196628Z","title":"Inter-SubNet: Speech enhancement with subband interaction,","venue":null,"work_id":"a412ff84-7414-46ef-b548-f9a5e0d9355e","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.228554Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:84e9ff7b28e8411a69a208932933ddf9b1217d25adfd43cbacd24ad5e9771cdd","observation_id":"2f12fc1a-ab0c-4be1-bf41-f9e334877e9d","resolution":{"observed_at":"2026-08-06T16:41:30.276332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.032080Z","title":"Speech enhancement with score- based generative models in the complex STFT domain,","venue":null,"work_id":"c06ca064-c774-4a62-8624-4e288e95ec2a","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.285617Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0258da6785ebe455ee8dd533970354cdf4da814f2785de10ffbf093b29b831fe","observation_id":"088a276e-0244-4d8d-a220-8b91476d8729","resolution":{"observed_at":"2026-08-06T16:41:30.099067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.863919Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":"24392ec0-d678-4546-85b1-ff993e75d2ba","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.330011Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5bd96bc055977c81be48be62528fbe338240468448b27bb446d3d6e97bbcecf7","observation_id":"5e1b7c46-5668-4312-9626-8d58d571b29d","resolution":{"observed_at":"2026-08-06T16:41:29.958000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T16:41:21.361135Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.361135Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:3c34d975f6d90fab7d3c503471ea1c23094791207f88552166a833f4be95e3bb","observation_id":"8613889f-de51-4e65-9069-7964de0f0b66","resolution":{"observed_at":"2026-08-06T16:41:21.361135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.769818Z","title":"AudioLM: A language modeling approach to audio generation,","venue":null,"work_id":"d696a8b6-460b-4bad-aeaf-692d9d37f9ed","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.498944Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:d6c06c3f498d49d35eb98b411bdf3311df669a5707879cf20293bc20a2d9b1df","observation_id":"1653c9ff-4f6d-4f06-9496-192d1dbb9766","resolution":{"observed_at":"2026-08-06T16:41:29.818197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T16:41:21.629566Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.629566Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:29928b0a86d83e8a96ee29148dd7d2c3ea03ef102b2a810f39ffb0d54d6d71d3","observation_id":"74a3577c-1780-4876-b29a-82e23297da18","resolution":{"observed_at":"2026-08-06T16:41:21.629566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.583700Z","title":"AudioGen: Textually guided audio generation,","venue":null,"work_id":"856eb329-154a-4322-828c-65aad800bd88","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.722632Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:3dff077b53dc19e08dc1ef08852124133fb2dad092cd31d10f2a250057db9ad5","observation_id":"6671abdb-b415-4c7b-bd0b-a128cb41d808","resolution":{"observed_at":"2026-08-06T16:41:29.706948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.405958Z","title":"Simple and controllable music generation,","venue":null,"work_id":"c1f19d17-1c48-48e5-8255-d9af51fad6cb","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.768399Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:48f21e9e298d64511571803d78697a3b28199a1237dd8934baf54e2c0bce94c8","observation_id":"d9e1c638-9978-44cd-a597-733794d16616","resolution":{"observed_at":"2026-08-06T16:41:29.481724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.283236Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"2acb5428-c2cc-4b8b-a88f-366cc17d6b8a","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.816868Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:bc38eeb3af2a151c22fdfdcda441d03035f44e8dfbf9eebc0e7cf972b613bcb2","observation_id":"6938a232-7650-4d7a-ada5-1fe8f8a563f0","resolution":{"observed_at":"2026-08-06T16:41:29.334844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-16T14:20:11.430991Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-06T16:41:21.849466Z","title":"SpiRit-LM: Interleaved spoken and written language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.849466Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0a92c322fea79a423634dfc2d71437ec93779eb0eb614bed5e993c9a78b96473","observation_id":"58acb5af-7763-4fe8-8b7d-e28357526c51","resolution":{"observed_at":"2026-08-06T16:41:21.849466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-16T14:12:35.270314Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T16:41:21.923372Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.923372Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:468ea9986e96494aad6d65c317321165fff24b8bbd92c3a53d2451224683e06a","observation_id":"0b40a5bc-c4cd-4454-a726-dccb894137ab","resolution":{"observed_at":"2026-08-06T16:41:21.923372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.169648Z","title":"CLam-TTS: Improving neural codec language model for zero-shot text-to-speech,","venue":null,"work_id":"58c38b5e-7722-43f3-bf05-b3584a4a5ca6","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.970115Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:54ad860d6fb553d929fa7180040c474c35df178cbf5155926c8e2d4cbaebddd9","observation_id":"30664f26-4e77-4c0e-ad97-2d57f991eedc","resolution":{"observed_at":"2026-08-06T16:41:29.225692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.043071Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"2ece4586-b8ac-4fe5-b973-7f0d5ca1aac6","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.023102Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:ebf11eb5dde8ae1cc77ad014825d73f4e888a378157dc6b131086180005126ce","observation_id":"142d4ed3-afa1-4be5-afaa-cd65ff7d8a71","resolution":{"observed_at":"2026-08-06T16:41:29.163173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.841663Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"186562a5-51a1-4102-b7af-a51a1fac35e0","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.073829Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:25508631fa7882313f58793534d1cf1345643d2325c0663e3107b5c23c66aacd","observation_id":"f6407d33-1e40-4609-8f85-a7910f2b5d29","resolution":{"observed_at":"2026-08-06T16:41:28.929929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.673058Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"3517da88-5676-419c-a517-29bbcd83d324","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.122399Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:7822b5481ed8cae0cf53092e986b27805e2754eb52d2949648fe0f532cb55ced","observation_id":"04558e90-fab5-4888-abe5-73419709325b","resolution":{"observed_at":"2026-08-06T16:41:28.740936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.487160Z","title":"Exploring speech recognition, translation, and under- standing with discrete speech units: A comparative study,","venue":null,"work_id":"15c91e75-72f6-4150-92a8-09b17db1463d","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.158395Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:96c27d223b377a3ed970c687bae7e05ee13687d281995808df644a2619fb764c","observation_id":"d3310284-c3fd-4705-a638-f3d2805089ba","resolution":{"observed_at":"2026-08-06T16:41:28.553359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.373647Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS,","venue":null,"work_id":"77c686c2-077b-41e4-9b4c-cd7eb6baff9d","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.198945Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:100b2d84b110742947420ab3079e2f3d5781b256237f7a47c9bba3b3623786d9","observation_id":"0efe4163-83cf-4165-bc53-079781c11db9","resolution":{"observed_at":"2026-08-06T16:41:28.431139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.259178Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"54e0b9e4-343f-4a08-a447-92ce8f4d7651","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.267201Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:178e96cc828ece85fc96b8409d50905d82b94ae4a953e87038b98644527f0c09","observation_id":"ac1b52f1-1ba6-4305-a834-3d58ea481eda","resolution":{"observed_at":"2026-08-06T16:41:28.306150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.132275Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"3a8d2a73-25da-4983-a1a7-35d48f1f8461","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.356681Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:d891a69cd10b1eef82c7f1225676f20f3394664a63ecc3ac71cbdd29c11093b0","observation_id":"648f0fb9-bcf4-496d-a021-a8bf03a59e6e","resolution":{"observed_at":"2026-08-06T16:41:28.189956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07405","last_updated":"2023-10-07T02:56:00Z","snapshot_observed_at":"2026-08-18T00:49:56.071782Z","submitted_at":"2023-09-14T03:18:24Z","title":"FunCodec: A Fundamental, Reproducible and Integrable Open-source Toolkit for Neural Speech Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07405","snapshot_observed_at":"2026-08-06T16:41:22.474153Z","title":"FunCodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.474153Z"},"links":{"cited_paper":"/paper/2309.07405","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:38644925f325e4a016384f25511aaa97edf264197224acfe39609608a1fff4a2","observation_id":"7fde69f3-fc30-4f7c-953f-f07cc1853b7e","resolution":{"observed_at":"2026-08-06T16:41:22.474153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-16T15:35:40.710158Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-06T16:41:22.610257Z","title":"HiFi-Codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.610257Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:548a2ad134fad501a62bfcb55132484b73afa8a29cc1daa40fce38f629247783","observation_id":"c46c1d72-99e2-425d-b195-235d3ac823e7","resolution":{"observed_at":"2026-08-06T16:41:22.610257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12208","last_updated":"2025-06-04T05:50:15Z","snapshot_observed_at":"2026-08-16T14:17:18.271173Z","submitted_at":"2024-02-19T15:12:12Z","title":"Language-Codec: Bridging Discrete Codec Representations and Speech Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12208","snapshot_observed_at":"2026-08-06T16:41:22.680479Z","title":"Language-Codec: Reducing the gaps between discrete codec representation and speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.680479Z"},"links":{"cited_paper":"/paper/2402.12208","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:1daafbff3e5aae60285ec6c19b2e4e8bba0b1b9c6a019ef8a1b29f7eecbc7638","observation_id":"a6287e80-8a80-45e9-a36a-58b36e9745e7","resolution":{"observed_at":"2026-08-06T16:41:22.680479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-06T16:41:22.809284Z","title":"WavTokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.809284Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:cc29a92b343c397a6108f506d4ea62a57ac41b3bcf9a0af2441f25fe4f8dc88e","observation_id":"98e1b8e5-0b0f-4ef6-9b04-5cb955d3283e","resolution":{"observed_at":"2026-08-06T16:41:22.809284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.002175Z","title":"Neural discrete representation learning,","venue":null,"work_id":"724381c9-4424-4bd8-a8c7-408ae58f43f1","year":2017},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.916480Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5a64e1acc613f9196322b006c7e968fd4c893cda2f870889a0520fe8e7f57275","observation_id":"5088cbb3-8115-47fa-81c7-5b20b0b4bde4","resolution":{"observed_at":"2026-08-06T16:41:28.056386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.885275Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"198dae4d-7ef1-4bcc-9ab7-d23880d380ac","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.018124Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:9c7fa3a964d63a504f1a5db140d2fd59f298a274a2984b21f12253aa5d707460","observation_id":"32b045db-4410-4c02-885d-2dceb1137dbf","resolution":{"observed_at":"2026-08-06T16:41:27.947347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.750402Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"cb27ee3a-472c-4148-a3a9-276dab5c77c3","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.100796Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a1d0b87d2cc08b7886b5997339d9b5b5d9110d0cb66c9225c4ea409275d0d6ba","observation_id":"0c837355-3f63-45e6-b395-7b1c9bb237a2","resolution":{"observed_at":"2026-08-06T16:41:27.817479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.593304Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models,","venue":null,"work_id":"35b7cfeb-608f-4e5f-977a-e9e18174c927","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.173030Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:4d842c29e63d684f522afb5faff46b5613e9aa090b074553e6711c4f3ace63cf","observation_id":"7df2ad59-42a6-45e9-9d04-283b68429eb7","resolution":{"observed_at":"2026-08-06T16:41:27.678992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-08-16T13:56:26.343800Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-06T16:41:23.288503Z","title":"SemantiCodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.288503Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:966251a82686aab277fe4745d007700838afbe3809606563bda9a86e7ce0bf08","observation_id":"2c8dbc01-1263-41de-a261-203542644dbe","resolution":{"observed_at":"2026-08-06T16:41:23.288503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.473162Z","title":"SELM: Speech enhancement using discrete tokens and language models,","venue":null,"work_id":"bac65ba8-a03d-4aba-be2e-d717941f7bcf","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.369185Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:63b21146d8d57feea6553f2e362c0374470efb72bd33c4bd7d9b53676c590656","observation_id":"b179fc50-6f9e-4b7e-8524-9e973e431d4e","resolution":{"observed_at":"2026-08-06T16:41:27.544450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.336677Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":"c42a4a52-d0ef-4d7e-8425-ec843b93de9d","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.474475Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:e75f0fa37124b28c8fa6d958f874aa5bbb32e006006c09640bc7f68905268207","observation_id":"93279da3-1f33-439e-bd5f-b487e7530aef","resolution":{"observed_at":"2026-08-06T16:41:27.406429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-08-16T11:37:40.476254Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-06T16:41:23.555526Z","title":"DASB - discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.555526Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:da5b7f3cf16de7e1ba97c155007c898492caa40fec57caf12435fc1dc8acfa3f","observation_id":"c3973daa-5f47-466c-8a08-417f7c839954","resolution":{"observed_at":"2026-08-06T16:41:23.555526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.163881Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"6d46963f-2563-4c51-9c12-e04feec62a9e","year":2012},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.647972Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0471bd66250ef17836015f7c17b228d1ad21e880b5fd17e2b4e383c94db863ad","observation_id":"6d6d836e-7b72-45b4-b9f3-74c4a0ef9553","resolution":{"observed_at":"2026-08-06T16:41:27.245159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.951076Z","title":"Exposure bias versus self- recovery: Are distortions really incremental for autoregressive text generation?","venue":null,"work_id":"09442c30-8147-4c92-8f91-3c360c96495f","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.781090Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:fa9d01dbe0cdf21cea5edf0b8b6b67be4b0ab1a3e53f0e5bf946aa25671e9e1a","observation_id":"b93cfe80-addc-44da-a5b2-a5873cf1277f","resolution":{"observed_at":"2026-08-06T16:41:27.069845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.783326Z","title":"Attention is all you need,","venue":null,"work_id":"b4c636d2-f02f-43f5-ae14-edf2e1ea728a","year":2017},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.869252Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:8b63b23852303e1ae265bcede388b104214729a66b0aa5b164c20533cb7fae34","observation_id":"aca6d0c1-f1dc-4216-b1ba-07e213de2718","resolution":{"observed_at":"2026-08-06T16:41:26.855278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.560496Z","title":"Investi- gating RNN-based speech enhancement methods for noise-robust text-to- speech,","venue":null,"work_id":"88187845-63d2-4709-801e-c6ed5941e77f","year":2016},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.957284Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5fc15b5ba79969a77b91d90a852aa51abed898c649ee322dbc4b25fc8af94544","observation_id":"a7884187-b14d-4804-bf43-66b8232a332c","resolution":{"observed_at":"2026-08-06T16:41:26.685195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-06T16:41:24.033479Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.033479Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:85486dd00b33074e2031082d702caf197148153d76c549678dccacc32cb6af14","observation_id":"203a6940-1875-4995-8852-f38d58673943","resolution":{"observed_at":"2026-08-06T16:41:24.033479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.399704Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"7755f303-12cf-4ffa-a55f-d64852ed9a49","year":2015},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.124884Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:276aa46c6f107b3cc20c18396f1516337eaf9585547131d2a1f36949be63a99b","observation_id":"299f3b0b-663c-4dff-85fb-05c235bb2da1","resolution":{"observed_at":"2026-08-06T16:41:26.479563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.215527Z","title":"WHAM!: Extending speech separation to noisy environments,","venue":null,"work_id":"d52740b1-f85c-41a0-8347-ed18df32c610","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.197555Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:b907c4ec00dde7c3e4a00e8c9b96f7899e74287e689ee8a58a1b810fefda4e67","observation_id":"9e1eed3b-10b3-4688-8958-3a9591133d2c","resolution":{"observed_at":"2026-08-06T16:41:26.303021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-16T15:27:27.142221Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T16:41:24.295671Z","title":"V ocos: Closing the gap between time-domain and fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.295671Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:598327066391dc6937d7424b322e7eb86c64f652753c0261f1aee71b9d99a4f9","observation_id":"5b2c4a59-bc6d-40f7-8ffb-889dc66184bc","resolution":{"observed_at":"2026-08-06T16:41:24.295671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.021674Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"ea9f0e37-780e-4768-9c05-b3274126f6fa","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.397498Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:845e28abe3fd085b904c8ff321f6d3185727495effa3d616c20b0da6dbb6d2ed","observation_id":"87fa2057-4541-4db6-b3fd-b883b847fb1b","resolution":{"observed_at":"2026-08-06T16:41:26.099361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.861052Z","title":"HiFi-GAN: generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"0dae2cdb-897c-479e-aba3-eebd3ff43a3b","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.449009Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:7801f260edf97d1b59fd2ae2ad15df3d054ad0ae662ede6810663a100b622333","observation_id":"7e90ddab-b579-488a-ad0d-45d1b734b7aa","resolution":{"observed_at":"2026-08-06T16:41:25.942088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.703849Z","title":"SDR–half-baked or well done?","venue":null,"work_id":"d9acc4a6-3890-475a-8e4d-dae461964749","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.536302Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:d83a8021809145132f881f552ad3611ef4b5c64b8f558720a4bf054769fc3bd1","observation_id":"ed1acbb9-c6b4-4e15-bc91-36390d02c712","resolution":{"observed_at":"2026-08-06T16:41:25.773788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.537957Z","title":"DNSMOS P.835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"b2960d1d-3b24-476d-9587-dd12fd99700e","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.615550Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:270aa607d78953c36ee107419c9277ccf62bbb18e25a7debd2f00ed58684ce85","observation_id":"fe0fb2b9-cd79-4037-a7af-6da541f5cfeb","resolution":{"observed_at":"2026-08-06T16:41:25.606167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.401806Z","title":"Sequential multi-frame neural beamforming for speech separation and enhancement,","venue":null,"work_id":"9723d753-120f-4872-b3b1-3206593b6abd","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.709317Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:cd608684d99e22a2caf0f0ec3852ad374a8c9cedc30b22102649482a201dc155","observation_id":"e1429f09-8f54-45c4-a2ce-c34d2ddece51","resolution":{"observed_at":"2026-08-06T16:41:25.475436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-16T23:32:22.645653Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:41:24.784828Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.784828Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a0834c3a35f1feac27bb79f799c2dabdf05e6756f67aa7664f35ad016a7f52f0","observation_id":"42d7cc22-0da8-414d-a31f-95b64b67886d","resolution":{"observed_at":"2026-08-06T16:41:24.784828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-16T23:10:15.763755Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-06T16:41:24.873492Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.873492Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:97a2f54074b1dc5952bebe7186080374bd3f01cfa026173a903df12e4b0314f1","observation_id":"90afd037-2529-483c-901a-2a3dbe73b7c4","resolution":{"observed_at":"2026-08-06T16:41:24.873492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00463","last_updated":"2024-10-16T16:13:32Z","snapshot_observed_at":"2026-08-16T13:38:30.712452Z","submitted_at":"2024-06-29T15:20:11Z","title":"Open-Source Conversational AI with SpeechBrain 1.0","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00463","snapshot_observed_at":"2026-08-06T16:41:24.944577Z","title":"Open-source conversational AI with SpeechBrain 1.0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.944577Z"},"links":{"cited_paper":"/paper/2407.00463","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2bb1938a1cc1a4779a9bd2d666c06357727918f9b1132405a9614a9fd8c0a29e","observation_id":"d73f1af6-a726-4f01-86c1-b4ed3f9564ad","resolution":{"observed_at":"2026-08-06T16:41:24.944577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.242914Z","title":"TokenSplit: Using discrete speech representations for direct, refined, and transcript-conditioned speech separation and recognition,","venue":null,"work_id":"974f0c5b-b556-4831-b0a5-4d3e3ecf0f1d","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:25.045627Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:e61921227cfbe6e34a243bcd9c83fe72575975203225b97432fc11c0e6ec7ccb","observation_id":"d8f5479f-9a8e-4cdd-b413-54133d9853df","resolution":{"observed_at":"2026-08-06T16:41:25.324407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T23:23:39.503713Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.12825."}