{"as_of":"2026-08-20T07:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1b268943c3078bec44bd717f09fdf5c2653c8597dce741f4aaf7f57b4ab3973","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:41:45.504981Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:48:34.841419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T16:46:37.685528Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"cited_work":{"arxiv_id":"2411.17998","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17998","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech separation using neural audio codecs with embedding loss, 2024 a","venue":null,"work_id":"4274b606-dc0f-44b2-a941-ec6f8bedf5cf","year":2024},"citing_paper":{"arxiv_id":"2509.11717","last_updated":"2026-06-21T14:09:38Z","snapshot_observed_at":"2026-08-14T15:38:25.067045Z","submitted_at":"2025-09-15T09:12:57Z","title":"CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T16:44:32.104114Z"},"links":{"cited_paper":"/paper/2411.17998","citing_paper":"/paper/2509.11717"},"observation_digest":"sha256:9d2462bb37e5820b0a6eb0501845f0112c20eab492f60c7903215fe198ece43b","observation_id":"7f0dc690-f759-4476-99b6-7b7e3466b511","resolution":{"observed_at":"2026-05-18T16:46:37.688387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17998","snapshot_observed_at":"2026-08-04T16:48:34.841419Z","title":"Speech separation using neural audio codecs with embedding loss, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11717","last_updated":"2026-06-21T14:09:38Z","snapshot_observed_at":"2026-08-14T15:38:25.067045Z","submitted_at":"2025-09-15T09:12:57Z","title":"CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents","version":6},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T16:48:34.841419Z"},"links":{"cited_paper":"/paper/2411.17998","citing_paper":"/paper/2509.11717"},"observation_digest":"sha256:3238aadc6ca14644eb5842a0c746e1107999c63c2db2f9b9a534f693204403a1","observation_id":"22b9aa25-409d-4d79-9cf0-d4d9f6c09442","resolution":{"observed_at":"2026-08-04T16:48:34.841419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17998/citation-record","integrity":"/paper/2411.17998/integrity","json":"/paper/2411.17998/citation-record.json","paper":"/paper/2411.17998"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.333593Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.333593Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:6164db0a41b6898b61aecda23a7056e94bc7cbeab1812116aa21074abbd4b458","observation_id":"69f94909-8948-4cc1-9db6-b80182fe6a11","resolution":{"observed_at":"2026-08-12T11:41:45.333593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:46.061339Z","title":"Atten- tion is all you need in speech separation,","venue":null,"work_id":"a767c635-41ba-4d53-8dce-1ee5ec5fff48","year":2021},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.340401Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:5483ae4335c106bc7dc529331de656450b09b93609779b947261a9937d8fe1b0","observation_id":"e92cd3e9-9beb-480c-bd97-e27a7b691490","resolution":{"observed_at":"2026-08-12T11:41:46.067206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:46.043537Z","title":"Spgm: Prioritizing local features for enhanced speech separation performance,","venue":null,"work_id":"3ab0cb1f-6633-405d-a44c-84ccdbed12e4","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.345659Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:d3fb34c6b5035cebe2ab5b603f710244b8f4c19d2610c5c7e1facdd23045f12e","observation_id":"ca44b4b5-c246-46a6-90e4-01c890318825","resolution":{"observed_at":"2026-08-12T11:41:46.049025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:46.024979Z","title":"Mossformer2: Combining transformer and rnn-free recurrent network for enhanced time-domain monaural speech separation,","venue":null,"work_id":"129fac33-0006-46df-9787-35cffb2c4d3c","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.351303Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:3f371c418988f0923b545f78d828d0027cdf7ac00e73d8978ac4f13a3822cdee","observation_id":"d76f519d-8cbc-4d7c-ba3b-07822213962d","resolution":{"observed_at":"2026-08-12T11:41:46.031180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:46.005823Z","title":"Gass: Generalizing audio source separation with large-scale data,","venue":null,"work_id":"7fd299c0-7d06-4d7f-a6a5-33854b0c521f","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.356597Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:565c40803d3e86236405510aad66093c650b8f44202513587c57f4ab2ba63897","observation_id":"599e8f6b-a545-44de-845a-4bcaeb6c6ede","resolution":{"observed_at":"2026-08-12T11:41:46.011198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.988632Z","title":"Exploring self-attention mechanisms for speech separation,","venue":null,"work_id":"a832237a-d332-4a2b-b4ce-05f7749a8c8a","year":2022},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.363038Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:125ccb3181108555d7b3ee09fd94b4a8858c77a9a8e6d88a0c0e4ae84638111e","observation_id":"2be18dab-e38d-47ce-bec7-d7f590469310","resolution":{"observed_at":"2026-08-12T11:41:45.993979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.968507Z","title":"TF- GridNet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":"2a048fbb-d0ff-4f09-8a46-3e55058b7796","year":2022},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.369277Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:ce21b8a085a2a1d82d5a76b9e3ee787581c0d7ae4bcb9529d677c7260167da21","observation_id":"b0a861b9-44e3-463f-b060-bfd07c4d0cb3","resolution":{"observed_at":"2026-08-12T11:41:45.974904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.951070Z","title":"A neural state-space model approach to efficient speech separation,","venue":null,"work_id":"4ca5b928-400c-42cb-a89a-745c231f08f6","year":2023},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.374305Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:415ceab09ff37cdd7b9a950ac02153c615dbac3d8fc5b3fd8d50451c604e4c62","observation_id":"fccdc939-376c-4d7b-94e1-9c641505d6a9","resolution":{"observed_at":"2026-08-12T11:41:45.956269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.933452Z","title":"Permutation invariant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"46668229-2677-4a29-ad6c-e87404dcc474","year":2017},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.381233Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:331b62d307c6287a25734215432afc845747736b14a5c986219af76fe7396286","observation_id":"df33a327-e700-4751-b367-6dd6c643002a","resolution":{"observed_at":"2026-08-12T11:41:45.939179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.386290Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.386290Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:c717a7c8eaa441fb14cb7a8673a54e1a02da6c668e284c8704e6889b2f4ce5b1","observation_id":"e8243670-d1ec-49ac-9c85-5f5b5b4e546f","resolution":{"observed_at":"2026-08-12T11:41:45.386290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.391032Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.391032Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:8c12220a37b20293f9812820643cbb658106134ed38124e0150bc36f479b2c32","observation_id":"d59cce01-1d76-4aa2-8e8a-43250db14d6b","resolution":{"observed_at":"2026-08-12T11:41:45.391032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T11:41:45.395769Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.395769Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:816985ad6dc103372142ab9050b425570205395d98efff89a5c8fec64d58aadc","observation_id":"117c8613-a45b-4ed7-b081-799e295d7930","resolution":{"observed_at":"2026-08-12T11:41:45.395769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.401593Z","title":"High- fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.401593Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:bc7c42bd2a4a20a334ea01afbcdfb45a25b6ceccb18edb60710efc0c47522893","observation_id":"06f22c58-3e30-4455-ba24-096d212cf527","resolution":{"observed_at":"2026-08-12T11:41:45.401593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.879162Z","title":"Vector quantization,","venue":null,"work_id":"5db86cab-69e8-4ff3-a090-24e11ff0ecd1","year":1984},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.407138Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:cc4c5ff88b606c2cb0c71343284193557be3fe89ac3bea6d7940ed1f0a19b0ab","observation_id":"3b162e68-e8e0-4646-a278-0daec62c0e03","resolution":{"observed_at":"2026-08-12T11:41:45.885444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-19T07:04:12.928329Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-12T11:41:45.414147Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.414147Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:cfa9dd14af6f12453b03c2f8ea5dc98a5236b391a0be3e3861a950f78b0dfc64","observation_id":"1a76d6cc-4751-466a-8922-2d176bc48e85","resolution":{"observed_at":"2026-08-12T11:41:45.414147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00235","last_updated":"2024-01-31T23:29:42Z","snapshot_observed_at":"2026-08-19T14:48:34.486714Z","submitted_at":"2024-01-31T23:29:42Z","title":"Exploring the limits of decoder-only models trained on public speech recognition corpora","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00235","snapshot_observed_at":"2026-08-12T11:41:45.420271Z","title":"Exploring the limits of decoder-only models trained on public speech recognition corpora,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.420271Z"},"links":{"cited_paper":"/paper/2402.00235","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:e05f633937a385d650e9017c03ae7578b0875b120c16d092ecf07f1c72bd23f0","observation_id":"10a6b267-3f43-42bb-ac11-4d53c1e4dbd9","resolution":{"observed_at":"2026-08-12T11:41:45.420271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.856670Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"16aa3856-c191-450e-889f-685424fc3519","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.426939Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:f7120af0a56caaac42b2c7a802fcd792552e4729c3a3e43ec4a54a70d154a933","observation_id":"826a5a72-243c-4839-8519-bb264089a574","resolution":{"observed_at":"2026-08-12T11:41:45.865570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-12T11:41:45.432669Z","title":"Simple- speech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.432669Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:3683be16440b086cc92fa1063f1cf0950c377e3d82af3405a7747b7ad3fa1d60","observation_id":"e0a27129-931a-4f22-92d5-d9946d014e29","resolution":{"observed_at":"2026-08-12T11:41:45.432669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.838232Z","title":"Discrete audio representation as an alternative to mel-spectrograms for speaker and speech recognition,","venue":null,"work_id":"fd037217-c112-4cda-a31f-245ea7760497","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.439015Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:68d9dbfb2e8a5cf54c829a317524054a75d932d9dd8f235484c915d4435d62e2","observation_id":"95d00d77-5065-4bec-bf4f-dfb640e74074","resolution":{"observed_at":"2026-08-12T11:41:45.843407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.820011Z","title":"The Interspeech 2024 challenge on speech processing using discrete units,","venue":null,"work_id":"88b5f112-ee6d-43a8-9906-8125884abe7f","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.446408Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:4aaf279594ac73b9c307378089fc97819b001c315530b25a4a7c3c5665494971","observation_id":"d14e5e27-71bf-4831-982e-9937e0dfdf04","resolution":{"observed_at":"2026-08-12T11:41:45.825518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.798943Z","title":"Towards audio codec-based speech separation,","venue":null,"work_id":"970a3949-b604-49eb-b8c0-748d956c8496","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.452343Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:93f4d04ffd79a4fbf732b9c4b7a2fcfba6aa88ec52a0590108c67d632dd2381c","observation_id":"adcd272e-f277-4ebe-b3df-d0d60ae0a7c5","resolution":{"observed_at":"2026-08-12T11:41:45.806074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.778525Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"9f22d6ad-18ab-44bd-9ed1-5b7708d593d1","year":2001},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.457424Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:b6c13a4d17bcc5bc6a417a3faf2190830aab3d94aa7a1f4668331519e28b5d28","observation_id":"5070b1e8-2b4a-497e-9a18-6239815fd0cf","resolution":{"observed_at":"2026-08-12T11:41:45.785316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.758605Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"5e13c5b3-1ce4-49a7-8bcc-e949d48cdb3c","year":2011},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.462773Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:217e294f561c84e2926baa52e619b403d06a06f2bc021cf32ec50d69c8e2895b","observation_id":"70b8d970-c0fd-4784-8c9c-dcfc20c0ee0c","resolution":{"observed_at":"2026-08-12T11:41:45.764170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.739419Z","title":"DNSMOS: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"8775b1ce-ad9d-4cce-af43-bcd43bf3f080","year":2021},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.469684Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:f934c6c374712abb91952bbef9c976678de93acb5c04d025bd9445b3d500450c","observation_id":"d74a01bc-ed42-4287-9de5-ccc68e404b89","resolution":{"observed_at":"2026-08-12T11:41:45.745444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.721748Z","title":"LibriTTS: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":"4ea4738f-d343-4947-811d-a4c59b6836e2","year":2019},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.476166Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:6ed0fbf24a3fc5339ce91d7dc5093c628a648077f7bcce9efdf17019f30577e4","observation_id":"89913a5f-146c-4aaf-b01e-3bf6813c3194","resolution":{"observed_at":"2026-08-12T11:41:45.726927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.702290Z","title":"Espnet-codec: Comprehensive training and evaluation of neural codecs for audio, music, and speech,","venue":null,"work_id":"8cb630be-d498-46be-8e46-c0227c0724a5","year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.482598Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:b357043eb52c659fbc3308e90c04832ea2e93d8fa9219bbff8e7b38d9838e4ec","observation_id":"bd200c3c-2545-495b-b079-7407a23aee08","resolution":{"observed_at":"2026-08-12T11:41:45.707945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-08-18T04:36:00.952991Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-12T11:41:45.487621Z","title":"Fast and accurate deep network learning by exponential linear units (elus),","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.487621Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:2d1a044552a6a2fa7dce01379ae76c07ebd654ceb27d905b69012caf1b0df468","observation_id":"8caa13cc-51dd-47b6-97e3-a59543962839","resolution":{"observed_at":"2026-08-12T11:41:45.487621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:41:45.684284Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation,","venue":null,"work_id":"a6005a8d-5865-465a-818e-533e849f6604","year":2016},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.493346Z"},"links":{"citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:09bf62163e1e5c09c4911b006f2aed9d5c7cead019a7327d7c690433e9cdc8af","observation_id":"b5da3910-e288-4e96-8884-8e5f96a2d5f6","resolution":{"observed_at":"2026-08-12T11:41:45.689821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-18T17:51:41.801692Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-12T11:41:45.499310Z","title":"SpeechBrain: A general- purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.499310Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:2d8d92796085b874604e135df0e0632162b294b843eb481e5ab70bbbf42dab91","observation_id":"6493b892-ae27-4d6d-9a59-3702ec38a7fe","resolution":{"observed_at":"2026-08-12T11:41:45.499310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09382","last_updated":"2022-01-09T14:28:38Z","snapshot_observed_at":"2026-08-16T17:33:51.073272Z","submitted_at":"2021-12-17T08:35:40Z","title":"Discretization and Re-synthesis: an alternative method to solve the Cocktail Party Problem","version":2},"cited_work":{"arxiv_id":"2112.09382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09382","snapshot_observed_at":"2026-08-12T11:41:45.549549Z","title":"Discretization and Re-synthesis: an alternative method to solve the Cocktail Party Problem","venue":"cs.SD","work_id":"da6bd8dd-f1f0-49f1-ba21-e452a27f99a3","year":2021},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.504981Z"},"links":{"cited_paper":"/paper/2112.09382","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:46cd8d535fa1f17d6832d2c6c763a13e4f20dc7f3e102ce97f9d7d5e1f3ba4fd","observation_id":"db757385-ea69-4f37-8717-c8a68321252c","resolution":{"observed_at":"2026-08-12T11:41:45.557966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2411.17998."}