{"as_of":"2026-08-22T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95d1d550bfa4f9a888a01d7266cee80a34bd763ac4c87b958a3b853a241c266d","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:52:24.351100Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.21003/citation-record","integrity":"/paper/2509.21003/integrity","json":"/paper/2509.21003/citation-record.json","paper":"/paper/2509.21003"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.13086","last_updated":"2023-12-10T13:52:10Z","snapshot_observed_at":"2026-08-16T17:12:04.691282Z","submitted_at":"2022-03-24T14:25:51Z","title":"HiFi++: a Unified Framework for Bandwidth Extension and Speech Enhancement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13086","snapshot_observed_at":"2026-08-15T15:52:24.064391Z","title":"Hifi++: a unified framework for bandwidth extension and speech enhancement","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.064391Z"},"links":{"cited_paper":"/paper/2203.13086","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5d55846db9705258ee12822c202447464266bdc8258e1b3fac00cc0b0e82b00c","observation_id":"722bff73-3f4a-4c7d-ad15-da88a87587ec","resolution":{"observed_at":"2026-08-15T15:52:24.064391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.069401Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.069401Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:404a60233c0c5149d844bede02127af1db3a5e2d4af1d4efebc3196054972c5f","observation_id":"4ff26baf-55a5-4bcb-9996-e2eff2c228b0","resolution":{"observed_at":"2026-08-15T15:52:24.069401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.064292Z","title":"FINALLY : fast and universal speech enhancement with studio-like quality","venue":null,"work_id":"3af9e2a4-f478-4ba5-87d0-947bc76422d4","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.073116Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:8ce1e263eaff6fb374424b60d68da803c4620beb7a9bca127ecaf2543e218378","observation_id":"12b76472-26ae-4fcc-808d-5927103070c3","resolution":{"observed_at":"2026-08-15T15:52:26.069557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.077044Z","title":"CMGAN: Conformer-based Metric GAN for Speech Enhancement","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.077044Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:4a5fa3e875abd55134bcfd7d49ba1ff2bf3aeb8485f1da01975f295ac3e160f3","observation_id":"28fe2e2d-1110-4f90-b4f5-a6d36d74cc5d","resolution":{"observed_at":"2026-08-15T15:52:24.077044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.081167Z","title":"An investigation of incorporating mamba for speech enhancement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.081167Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:778e14c3e5a132f45f15859bc25c441722173014bf6e49e71863ea44bcebbbb7","observation_id":"f06e1bc5-ee90-464d-856b-314009fd65c1","resolution":{"observed_at":"2026-08-15T15:52:24.081167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.048888Z","title":"Wav LM : L arge-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"f968ba41-da00-451f-b09c-2f170fb5c144","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.085232Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:31e10d7865ff635e05c766b3503cc177ee04bf093b1513dc236ffb441dd58a0d","observation_id":"f3c85346-984a-4633-a78f-d70e3e22258b","resolution":{"observed_at":"2026-08-15T15:52:26.053415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.035210Z","title":"Phase-aware speech enhancement with deep complex u-net","venue":null,"work_id":"bf1e2d19-ead3-48d6-a43b-69eac6d0d41a","year":2018},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.089552Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:4f9f3b28238ced45ab55a29d85ab8bbd33f19c52e5609a1db251fb15f785b982","observation_id":"ce7e07a5-fd8d-4910-8dda-141473f20f27","resolution":{"observed_at":"2026-08-15T15:52:26.039699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.13254","last_updated":"2021-04-28T14:37:48Z","snapshot_observed_at":"2026-08-20T07:45:07.515320Z","submitted_at":"2019-11-27T13:50:45Z","title":"Music Source Separation in the Waveform Domain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.13254","snapshot_observed_at":"2026-08-15T15:52:24.097351Z","title":"Music source separation in the waveform domain","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.097351Z"},"links":{"cited_paper":"/paper/1911.13254","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b3890dbb2f7f1b305d2f706413425c395713144a4a97dfa14ddc80dc58818a5a","observation_id":"f5079de6-8033-46a0-b0a3-2de738c5a85a","resolution":{"observed_at":"2026-08-15T15:52:24.097351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.022133Z","title":"High fidelity neural audio compression","venue":null,"work_id":"fff42c23-709e-4a01-ad2f-e97347fa020e","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.103201Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:06fa3ae26ae76d5917512fd70132cb3d965f45eaa50b3f22bb09e1b4f93fe5f1","observation_id":"cec2f676-3d67-450c-a938-88ab78b0d24a","resolution":{"observed_at":"2026-08-15T15:52:26.026308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:26.008970Z","title":"Speech enhancement using a minimum-mean square error short-time spectral amplitude estimator","venue":null,"work_id":"b0ec864c-085b-4142-9bf1-4168b364c228","year":1984},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.107999Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ce0a0718e5398b79dbcc396f620b5845dc8c8cf0a95979f9f860ce4da9c186a6","observation_id":"ac3af8cf-7761-41e8-8e0f-97026986cf21","resolution":{"observed_at":"2026-08-15T15:52:26.013375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1992.22595","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.543815Z","title":"Fukada, K","venue":null,"work_id":"df5378a9-6f5d-470d-8b10-de5ca97271a4","year":1992},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.112131Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ed3cd7de646430c24743ea8512f430235f60de165948b417bbcebd553e7be9a5","observation_id":"ff94df62-d4ee-46a1-8ea8-92592592a974","resolution":{"observed_at":"2026-08-15T15:52:25.549465Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.116004Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.116004Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:31ed870c49446b798323219bcdb460dfa2ea00d2d2df7fd284c499e0ee30bbf0","observation_id":"9199065b-0c8c-4b51-9f65-8f6c3cec3c23","resolution":{"observed_at":"2026-08-15T15:52:24.116004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.987253Z","title":"Siamese masked autoencoders","venue":null,"work_id":"666a411e-b397-429f-8e46-9a2704be030d","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.119911Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:53bf0589047860a8698ea8c05b42c51328ec3099dbca5965de6d720ba3dd1725","observation_id":"2ea3e9cf-dc04-4e7f-8564-07a03bc6ecb0","resolution":{"observed_at":"2026-08-15T15:52:25.991088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.24166","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.476244Z","title":"Woods, Ivo Merks, and Tao Zhang","venue":null,"work_id":"04974cd2-40c8-4a26-ab82-e4e7a916db32","year":2015},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.123738Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e8cf01602ad612b9e942aaf90e7f317a6c77247319c79664dc01d619b61d58a5","observation_id":"21d54377-fc90-448a-a0f0-d82abaa864a4","resolution":{"observed_at":"2026-08-15T15:52:25.482416Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.127625Z","title":"Nu-wave 2: A general neural audio upsampling model for various sampling rates","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.127625Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:111a067616993e38892e74c24452bc2fb157655f37f7f76b59eee50f1056aaf4","observation_id":"8b177e32-0986-4b0d-9e73-7728825ebb5d","resolution":{"observed_at":"2026-08-15T15:52:24.127625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.974438Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"92cdf597-98c2-4285-ba17-645ec5a40527","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.131726Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a5c4bb0c09596730ccb14ecfa61058a7baa2782821aa76101e54681142e0b930","observation_id":"9fb50caa-896d-4f5e-874a-c25cf45aa390","resolution":{"observed_at":"2026-08-15T15:52:25.978656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.135855Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.135855Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a599a293584db6e938dde9eb11c1be7c62e5ce89cb1155173fb6fd340b4ba5aa","observation_id":"998ad533-58da-4391-88e8-743862b414ee","resolution":{"observed_at":"2026-08-15T15:52:24.135855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.139702Z","title":"DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.139702Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:aa180ca808b148b44e55bdd042b7042d6de780b79818a02001aa73074d5c149f","observation_id":"716289df-68d6-4532-8cc8-0deb38f73c64","resolution":{"observed_at":"2026-08-15T15:52:24.139702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2009.52012","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.403701Z","title":"A binaural room impulse response database for the evaluation of dereverberation algorithms","venue":null,"work_id":"a00a5ee7-dfe5-483d-8557-254a98f12af8","year":2009},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.143082Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:8aa14f0ab64589913b045b92cc6caa13b08d6dbc1c0de96daab6ac8c1b9ce4ab","observation_id":"ad2083f0-eb7c-4bbb-95df-03799a5081d0","resolution":{"observed_at":"2026-08-15T15:52:25.412666Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.953386Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":"4443de51-ed6f-4060-83ce-d7a56f94ef64","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.146547Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e9366d2720c9b4255099bcd1e1812f6c8d58b0102a59a7d2d859f1adaff3b533","observation_id":"2849cac0-8e53-4638-a482-8554c3c9d75e","resolution":{"observed_at":"2026-08-15T15:52:25.957265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.150172Z","title":"Istftnet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time fourier transform","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.150172Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:070d159a93bc8e4998230fba94a8bddd6ec9cade64e274cb2f12d9f25a3f9ef6","observation_id":"9543eb44-9c13-48a6-80bb-21ece9644aa3","resolution":{"observed_at":"2026-08-15T15:52:24.150172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.153665Z","title":"Audio super-resolution with robust speech representation learning of masked autoencoder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.153665Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5452ff71648d8b6fc7d6ae1f1df6b9a2f6aea5daa365a4eb106d81a2ec0f0616","observation_id":"5e523f2e-bd4e-4c65-a96e-0d38bf85838f","resolution":{"observed_at":"2026-08-15T15:52:24.153665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.940802Z","title":"Miipher: A robust speech restoration model integrating self-supervised speech and text representations","venue":null,"work_id":"70a7568d-b261-4a67-a6da-07df841c6b8a","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.157259Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:c2a780730c49b66d28e683045bfb3f48b7a943b0c3df317f18b3d11f20bf0862","observation_id":"94ce9f12-6aea-4630-ade6-89ddb136b386","resolution":{"observed_at":"2026-08-15T15:52:25.944807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.928232Z","title":"Hifi-GAN : Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"be479d92-f07e-4a90-bd45-f41e3932603e","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.160946Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:26957eef4140dcbc0800836ecfe2bb58162cdebcf67b2465c63b6593b3bc5474","observation_id":"d2d4da27-a862-4ba1-bdce-23373c753fae","resolution":{"observed_at":"2026-08-15T15:52:25.932328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-15T15:52:24.164463Z","title":"Diffwave: A versatile diffusion model for audio synthesis","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.164463Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b7f8b2f6e3bd3d78b0e7104b55d7aa4a91d7a4ac4720d505dbcc220980fe23f2","observation_id":"c0130c57-6d2c-44fd-b9b9-afc6b2a817f2","resolution":{"observed_at":"2026-08-15T15:52:24.164463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.915786Z","title":"Mel GAN : Generative adversarial networks for conditional waveform synthesis","venue":null,"work_id":"f878ad4e-dff4-47a6-b8af-5a7f535d95d1","year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.168258Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5b8164263ab94e1d550e1bb2ba8c71faec8505849ab0dbc0d3adb086555a5d8d","observation_id":"279a4b4e-b87d-428e-b53f-33da0aa0d518","resolution":{"observed_at":"2026-08-15T15:52:25.919934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14748","last_updated":"2023-05-30T13:05:55Z","snapshot_observed_at":"2026-08-16T15:52:00.816531Z","submitted_at":"2023-02-28T16:45:42Z","title":"Reducing the Prior Mismatch of Stochastic Differential Equations for Diffusion-based Speech Enhancement","version":2},"cited_work":{"arxiv_id":"2302.14748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14748","snapshot_observed_at":"2026-08-15T15:52:25.266457Z","title":"Reducing the Prior Mismatch of Stochastic Differential Equations for Diffusion-based Speech Enhancement","venue":"eess.AS","work_id":"9b93d9d1-2dcf-4c97-81e8-0a20195556a3","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.171779Z"},"links":{"cited_paper":"/paper/2302.14748","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:dbda3fdbdfdca8d37bfea0d3ebc408e20894eb1a33aae70c1d2b69ed92d6b307","observation_id":"8bee52d2-34fc-41c0-af86-f4b4a730d2e7","resolution":{"observed_at":"2026-08-15T15:52:25.270686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.175698Z","title":"Nu-wave: A diffusion probabilistic model for neural audio upsampling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.175698Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b1bdebc2239e8407862033595f07a1a2882895f109714c5f8d8f9cc2323d4a2a","observation_id":"feff9b80-e8d7-4eb3-ab24-8b3b414d8be1","resolution":{"observed_at":"2026-08-15T15:52:24.175698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.903495Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation","venue":null,"work_id":"df71c5f5-2e7a-4caa-8b18-0d5affa908d8","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.179509Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:08d43628b5014f07dabd928678e0a7dbe56f8f4befa7c55fbf4cd45c23dfa6c7","observation_id":"da10d043-296f-4804-9544-248f10741892","resolution":{"observed_at":"2026-08-15T15:52:25.907799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1584","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.463259Z","title":"MaskSR: Masked Language Model for Full-band Speech Restoration","venue":null,"work_id":"df9a1579-926c-4ff8-9438-e8f26b15366a","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.183168Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f2b2bc937feb60d1c390d786094f88db7191a9c900f1d53a20f855024f1dd871","observation_id":"08b758f6-8b65-4b1e-8b94-521ac97ebb19","resolution":{"observed_at":"2026-08-15T15:52:24.466990Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-11017","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.451437Z","title":"Neural vocoder is all you need for speech super-resolution","venue":null,"work_id":"42558c09-bf2c-4efe-8567-43c70ee196a3","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.186923Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:d9a53a2b19d9a10e428d57c98f93c9ac47d0b867c6d9cac6b9dd0fee58937e23","observation_id":"5249730c-98da-4afc-b2db-e844417d3915","resolution":{"observed_at":"2026-08-15T15:52:24.455483Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.190696Z","title":"Voicefixer: A unified framework for high-fidelity speech restoration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.190696Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5eef2a54e7c8f331e0d8045c22e66b74ad6b11e8bd18c3d53a950a747005d36b","observation_id":"4ef50da4-e2f4-42a5-aa96-2838749eae24","resolution":{"observed_at":"2026-08-15T15:52:24.190696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.891492Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"9a184042-8c04-4668-a7df-40ccc409c194","year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.194835Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:1a2ba0970c311c731449c91f56eaccc910c25c5c5baeae2cf780815c1705f7bf","observation_id":"bd17b453-3646-4849-b92c-1b591c431cd2","resolution":{"observed_at":"2026-08-15T15:52:25.895367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.878796Z","title":"MP-SENet: A Speech Enhancement Model with Parallel Denoising of Magnitude and Phase Spectra","venue":null,"work_id":"c202d261-f3a9-45aa-afa8-0f02f72e88bc","year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.199767Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:55235f0ce61a0b5da603ab20daad03c60894d6852eca31893b89065b5f19abbd","observation_id":"59e62475-cb9f-4106-8846-ea6fe91e9775","resolution":{"observed_at":"2026-08-15T15:52:25.883033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.204761Z","title":"Towards high-quality and efficient speech bandwidth extension with parallel amplitude and phase prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.204761Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:3684c9c499e1046aee3567df247d467897dd2760b129c2c1c1d3272f124ece85","observation_id":"57457866-5719-4041-bcfc-8d58481740c5","resolution":{"observed_at":"2026-08-15T15:52:24.204761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.866421Z","title":"Understanding and improving transformer from a multi-particle dynamic system point of view","venue":null,"work_id":"0b462f85-07c0-479f-a993-7028a8a265f3","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.209028Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:781ecef9996b5a79dbb2cd81d84b803bff305718f153b0fba8d428d818aa3412","observation_id":"3c6e36ce-253d-43bd-8cea-742829b5c31f","resolution":{"observed_at":"2026-08-15T15:52:25.870228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.89372","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.194688Z","title":null,"venue":null,"work_id":"5f737441-cdf1-4a30-abee-9387e980d1e4","year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.213031Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:2ef3e14e3ece1106ea5318e2b7e7419702e2ba947bdf15485ff0a6b487dbb2be","observation_id":"d6ddec0c-013c-40a8-8960-36ad159cc3b0","resolution":{"observed_at":"2026-08-15T15:52:25.200515Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.855469Z","title":"Least squares generative adversarial networks","venue":null,"work_id":"bf700dae-2fe8-4cf1-92d7-f3969e374354","year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.216953Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:886a47f056848561e95a3c85716a47863ee3b4fecbfaae9b407f0d22a92f36d0","observation_id":"812b17fa-0ad8-4ef5-8de0-e2b638ebed1d","resolution":{"observed_at":"2026-08-15T15:52:25.859221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-18T23:33:12.915054Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-15T15:52:24.221637Z","title":"VoxCeleb : a large-scale speaker identification dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.221637Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:39dab9568ec97ba267ba908d7bb02bfb35c745b79b0b495a26a24401c45ca25b","observation_id":"36b9502b-ba93-495d-b727-bbef41646e15","resolution":{"observed_at":"2026-08-15T15:52:24.221637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.842614Z","title":"Acoustical sound database in real environments for sound scene understanding and hands-free speech recognition","venue":null,"work_id":"c8476eee-5b0b-4170-ab03-c39874fe211f","year":2000},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.226451Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b98f6f26b68fb1215be09c8d1ad49a608e23f8f03a3787e0dc25a6a8bbce4c00","observation_id":"9a40b620-d7af-4c5b-a6e2-9746b1cf3d1e","resolution":{"observed_at":"2026-08-15T15:52:25.847371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-15T15:52:24.231010Z","title":"WaveNet : A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.231010Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:72993995e8734ef84d7893a0e31bbc56d58404451e447e5d631bca3818f31ada","observation_id":"7185565a-62d7-4343-b659-6811f728c56d","resolution":{"observed_at":"2026-08-15T15:52:24.231010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.235299Z","title":"SEGAN : Speech enhancement generative adversarial network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.235299Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:5da47a248586625c1c1bbb9b2cbed29aa24019005f54a711524bd3af0369b150","observation_id":"cb79c9df-6b45-4763-9d60-901e436bde4a","resolution":{"observed_at":"2026-08-15T15:52:24.235299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.239258Z","title":"Sampling frequency independent dialogue separation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.239258Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:1ac9b47fce240756f43877a2259820ca1aa568835c213c17a47b0632c2472b13","observation_id":"c1b0cc78-7659-40cd-8100-f7ce1f68f828","resolution":{"observed_at":"2026-08-15T15:52:24.239258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2020-3038","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.424903Z","title":null,"venue":null,"work_id":"b9de5429-8b13-4b24-8696-979c5914f39b","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.243272Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:0efbf0db0e71cc9d05930b1e8a7845daefaa4fcbe640ad8e6354e4a6ee4a3438","observation_id":"d0478b96-e4c0-4add-b822-e2b4a0fa53a0","resolution":{"observed_at":"2026-08-15T15:52:24.429829Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.829381Z","title":"Dnsmos p","venue":null,"work_id":"458a0582-c804-4093-b7f8-d319b27f6266","year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.247006Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ce19af1bbf06f8b3874f4be9e01bc6d429a7f802e7998bc43c31d4f4c0ee74a9","observation_id":"e781e7cd-a9b3-4b21-850e-73a877a3b212","resolution":{"observed_at":"2026-08-15T15:52:25.834045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.250925Z","title":"Speech enhancement and dereverberation with diffusion-based generative models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.250925Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:7138a93747635796e7383323d85330df71e517ad9521fc68e761b84c7e3061f1","observation_id":"97abd07c-23d9-443a-95fa-d22d0c26a774","resolution":{"observed_at":"2026-08-15T15:52:24.250925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.254732Z","title":"Rix, J.G","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.254732Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:45ef48e72af66a52a5ebf08e4048ee96d0f0ea0e055fe50b3a969a9047e3d61d","observation_id":"3d4bfadc-1bfb-4858-8ea4-b20b71eaa3f0","resolution":{"observed_at":"2026-08-15T15:52:24.254732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02508","last_updated":"2018-11-06T17:20:05Z","snapshot_observed_at":"2026-08-14T18:03:15.569348Z","submitted_at":"2018-11-06T17:20:05Z","title":"SDR - half-baked or well done?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02508","snapshot_observed_at":"2026-08-15T15:52:24.258584Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.258584Z"},"links":{"cited_paper":"/paper/1811.02508","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:08e96623264c82a09b0b02cb288b0bac2fedaef8ad2487dfa3741156e0ada6ba","observation_id":"41dd7175-598a-4569-87cd-1b6335d9619f","resolution":{"observed_at":"2026-08-15T15:52:24.258584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-20T05:06:38.014724Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-15T15:52:24.262602Z","title":"UTMOS : Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.262602Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:0b610fa6f8e5ce2e2a6dc9b59fb8d18bc6fe9d37678ab7ab3c1fc9e5087dbf47","observation_id":"23e9446b-a5d3-41e0-92e9-bc07ad1ed059","resolution":{"observed_at":"2026-08-15T15:52:24.262602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1508","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.410170Z","title":"SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics","venue":null,"work_id":"18b55840-bd0f-44e2-8d92-e0c9ce7b5caf","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.266432Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:60ea00aa12fd1c59b3dd99acee01aa697535f7fccd1f4ae04473068c1e3e9f90","observation_id":"a9d32f5b-a80f-423f-83d9-ed67b7750775","resolution":{"observed_at":"2026-08-15T15:52:24.416284Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1483.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.881614Z","title":"Germain, Zexu Pan, and Jonathan Le Roux","venue":null,"work_id":"3b332832-0087-4dc3-b21b-286fcc466564","year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.270059Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:1976d0d5cc98c6cab3ac381035ab6a361c9e92a204fe9459c426ffd91dc2f6db","observation_id":"cf7ffad8-aa94-417d-ade1-0937a0db4d2a","resolution":{"observed_at":"2026-08-15T15:52:24.888101Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.273778Z","title":"Universal score-based speech enhancement with high content preservation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.273778Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a36fa257aa7a4150b8507449420074f2f966e60712e4bea200df868979d588bd","observation_id":"cc7e48ce-8201-4cbe-8f4e-da55c57f11f0","resolution":{"observed_at":"2026-08-15T15:52:24.273778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03065","last_updated":"2022-09-16T10:27:27Z","snapshot_observed_at":"2026-08-16T16:54:50.395014Z","submitted_at":"2022-06-07T07:32:32Z","title":"Universal Speech Enhancement with Score-based Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03065","snapshot_observed_at":"2026-08-15T15:52:24.277223Z","title":"Universal speech enhancement with score-based diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.277223Z"},"links":{"cited_paper":"/paper/2206.03065","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:bc413c11a5487642d6174a9209cbd55e907a6f383cb82f47dcc791ae4acd72d8","observation_id":"1e516b92-a0e1-4936-9a3f-4a507253294a","resolution":{"observed_at":"2026-08-15T15:52:24.277223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.280951Z","title":"TF-CorrNet : Leveraging spatial correlation for continuous speech separation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.280951Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:756afd06b3b91623342d77ac94d33eb1afad768fb5d9c4449c67f60420f971d2","observation_id":"7ba965f3-a0cc-412d-baff-8769279d88ae","resolution":{"observed_at":"2026-08-15T15:52:24.280951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03185","last_updated":"2018-06-08T14:29:08Z","snapshot_observed_at":"2026-08-14T19:05:59.076260Z","submitted_at":"2018-06-08T14:29:08Z","title":"Wave-U-Net: A Multi-Scale Neural Network for End-to-End Audio Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03185","snapshot_observed_at":"2026-08-15T15:52:24.284675Z","title":"Wave-u-net: A multi-scale neural network for end-to-end audio source separation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.284675Z"},"links":{"cited_paper":"/paper/1806.03185","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:04b806c78035f05aa1257a806d9b7cbdd548058a860fb4a23d7a9d2127e6d839","observation_id":"4c51322f-bb06-44e5-a772-2ff02dcfc409","resolution":{"observed_at":"2026-08-15T15:52:24.284675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.288666Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.288666Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e951b54304b6d413cf6dc1c31787831e1ef2fa859cd4ec202194d418fd10a371","observation_id":"ae75efaf-9828-49d6-9f15-1a9fd995b10a","resolution":{"observed_at":"2026-08-15T15:52:24.288666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.817566Z","title":"HiFi-GAN : High-fidelity denoising and dereverberation based on speech deep features in adversarial networks","venue":null,"work_id":"5f88aedb-4f39-4012-aac4-57cffaaafb47","year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.293848Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:6bd2bcf936e9b0476851896e1f10209dcfdc03d77dd4fa535b6a9f1c251bd893","observation_id":"5ae4aab7-3567-4818-97c5-1fe1ca6ff42d","resolution":{"observed_at":"2026-08-15T15:52:25.821764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.803847Z","title":"HiFi-GAN-2 : Studio-quality speech enhancement via generative adversarial networks conditioned on acoustic features","venue":null,"work_id":"45c04f52-1805-4c67-8151-fd4a919c79c2","year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.297653Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f9d8d767893039faaff2a96422c5572a15d36e516e809089516ff5878e968507","observation_id":"d29af622-c388-4d41-9984-2944039aea88","resolution":{"observed_at":"2026-08-15T15:52:25.808820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.301098Z","title":"The diverse environments multi-channel acoustic noise database (demand): A database of multichannel environmental noise recordings","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.301098Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:52902c1aade57eacea5cae847261da213b9cc15b6be5f80e6609678e79dfb836","observation_id":"5b100efb-f0fa-4f83-95ec-e6ea0a7b663f","resolution":{"observed_at":"2026-08-15T15:52:24.301098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.791106Z","title":"MLP -mixer: An all- MLP architecture for vision","venue":null,"work_id":"20cfd7e3-bb4b-41dc-82b0-2c3edfd1237a","year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.304998Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:370d4d0d0fa4c05ebfde5ed6c6cd8a1a53e7513206a28038b4a4df3a2d83ccc9","observation_id":"f7796bad-0a21-46ef-8598-dfb70950e765","resolution":{"observed_at":"2026-08-15T15:52:25.795001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:25.778644Z","title":"Noisy speech database for training speech enhancement algorithms and tts models","venue":null,"work_id":"bd29c4fd-7bbd-45bd-9659-249086ae3087","year":2017},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.308600Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:4f6a94f0a6a0c61801c409a10de60d7959b37a8a80bbbd9baed50efab05d7651","observation_id":"679364b5-2252-4887-8de0-912d6a901c0b","resolution":{"observed_at":"2026-08-15T15:52:25.782747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.312017Z","title":"Li, Madian Khabsa, Han Fang, and Hao Ma","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.312017Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:7cce98e45bfb0de11f513276bb42b18debd502b6edf9e36186779b13b78400aa","observation_id":"598139cb-862b-4f8c-a555-6c66271cc12a","resolution":{"observed_at":"2026-08-15T15:52:24.312017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.315692Z","title":"Deep learning based target cancellation for speech dereverberation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.315692Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ac6fa94a9315e211e3ea63869b23bb9af103ea0a154eaf0bfed5e6878503ca84","observation_id":"d782d6ff-9143-40e1-9118-0b4443934b93","resolution":{"observed_at":"2026-08-15T15:52:24.315692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.319973Z","title":"TF-GridNet: Integrating Full- and Sub-Band Modeling for Speech Separation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.319973Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:e63075af971d1fe6d7b2fbe5cb6dbda6d477d029b4c204989603698f475c0c7e","observation_id":"0593af82-c16d-4545-91b0-485fe27df438","resolution":{"observed_at":"2026-08-15T15:52:24.319973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.323938Z","title":"Speech enhancement with score-based generative models in the complex STFT domain","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.323938Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:f450953ce2a109f002989047f08b116e07a49e4bf6b7486d6a9be5092818e3a0","observation_id":"61d5e02d-8272-417c-8041-590ee5ef7bd2","resolution":{"observed_at":"2026-08-15T15:52:24.323938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.327790Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.327790Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:65b1d2fa0aa6a628b56633b021839d42afc752afdf40e6987a552e2fe5d6f17e","observation_id":"8709e9c6-028f-4f9e-b02a-4bf069869d84","resolution":{"observed_at":"2026-08-15T15:52:24.327790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06467","last_updated":"2022-02-14T11:59:32Z","snapshot_observed_at":"2026-08-19T21:54:00.541086Z","submitted_at":"2021-10-13T03:03:49Z","title":"Dual-branch Attention-In-Attention Transformer for single-channel speech enhancement","version":5},"cited_work":{"arxiv_id":"2110.06467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.06467","snapshot_observed_at":"2026-08-15T15:52:24.567124Z","title":"Dual-branch Attention-In-Attention Transformer for single-channel speech enhancement","venue":"cs.SD","work_id":"2c413a77-f07b-4077-bdbd-de55d36a345a","year":2021},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.331193Z"},"links":{"cited_paper":"/paper/2110.06467","citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:43bbab4c9b33a57a0dc7b67a2549568688567bb401af18f45f4c42a61463a7a7","observation_id":"30014cd1-a7c4-425a-9a0f-72aee611f456","resolution":{"observed_at":"2026-08-15T15:52:24.573066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.334583Z","title":"Toward Universal Speech Enhancement For Diverse Input Conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.334583Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:6498cd4463b108487a2142605303f4196f18457dbfdc0ea67749f9fcf5493ded","observation_id":"5e13155e-e186-49ea-9f4e-f88605e8918a","resolution":{"observed_at":"2026-08-15T15:52:24.334583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.338328Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.338328Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:a549785a28aef60bcec75f2467ad5fe9045c7e4573dca50428e1a7691aae765c","observation_id":"fd238da2-4c31-4b6c-9884-b482691dbb69","resolution":{"observed_at":"2026-08-15T15:52:24.338328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.342712Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.342712Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:abd7955651ca8cb7833a1a44614a1bc246088bdb6d1eaec3927d8673fd7ceb6c","observation_id":"7e5d9f6a-1359-43f7-922d-23199e1b8b1b","resolution":{"observed_at":"2026-08-15T15:52:24.342712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.346958Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.346958Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:ec85552e7a44d0bca8d9efa1fd7d752929e9ce37c0cad0559b7fafe9326c4ea9","observation_id":"133a79d6-9029-4bc5-9cf8-0a348e1caa6c","resolution":{"observed_at":"2026-08-15T15:52:24.346958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:52:24.351100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T15:52:24.351100Z"},"links":{"citing_paper":"/paper/2509.21003"},"observation_digest":"sha256:b6b4e4e195c63566629587a071c11faad9889fb40ab6511220a8f5a41d67c361","observation_id":"4e823c6b-5b27-4863-a7ff-29e626ad7f49","resolution":{"observed_at":"2026-08-15T15:52:24.351100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.21003","last_updated":"2026-07-08T13:25:14Z","latest_version":4,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T08:21:24.897498Z","submitted_at":"2025-09-25T10:57:13Z","title":"Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":39,"verified_exact":7,"verified_fuzzy":22},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2509.21003."}