{"as_of":"2026-08-12T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99577911469b1738fd7958d2568acf7dbf028d12da9faeb81b3ae4a806f71a0e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:33:19.743287Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:33:19.656344Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:59:54.992758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-08-05T23:33:19.656344Z","title":"Additionally, a discriminator is used solely for adver- sarial learning, which we will describe in Section 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.656344Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:ac2faec7a1689d3a6064cd0bd14ccdcbe5865b20e69d2561d1c9230e55d094a2","observation_id":"e200ab57-0403-4138-9ffa-c999d9a924c8","resolution":{"observed_at":"2026-08-05T23:33:19.656344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:c57344af035a8e9f63714c785847a58c1096222fe0c0c6ae80daaab1c8f25116","observation_id":"20135b68-3616-4b79-bada-563d7092f5ab","resolution":{"observed_at":"2026-05-20T14:53:23.193610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2606.06357","last_updated":"2026-06-04T16:25:07Z","snapshot_observed_at":"2026-08-12T03:15:42.764171Z","submitted_at":"2026-06-04T16:25:07Z","title":"F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T23:36:27.369551Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2606.06357"},"observation_digest":"sha256:41f22d0e89f3552fdc111ed4e98209b5055c01a033ed33ef095be1dc6ec00752","observation_id":"b2cc25e2-41b0-46ab-befa-0627564b6e5a","resolution":{"observed_at":"2026-07-02T15:47:06.024654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2606.27320","last_updated":"2026-06-25T17:33:09Z","snapshot_observed_at":"2026-08-03T01:51:36.685656Z","submitted_at":"2026-06-25T17:33:09Z","title":"Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T02:08:02.803410Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2606.27320"},"observation_digest":"sha256:94b431f17b92e7a0f5d42786180dd73e501f01ace584dd2c870d7b2efb7ffd54","observation_id":"fa6bc4a9-da85-414c-939f-4e0da604a108","resolution":{"observed_at":"2026-07-04T14:59:54.994613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05207/citation-record","integrity":"/paper/2508.05207/integrity","json":"/paper/2508.05207/citation-record.json","paper":"/paper/2508.05207"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.515481Z","title":"The de- velopment of SoundStream [1] was a key development that unlocked the potential of autogressive audio generation with standard language-modeling objectives [2]","venue":null,"work_id":"20e22483-f3da-4396-9359-8b3f39c83a84","year":null},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.652938Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:e28d86ab717f2571392b70fa3f57d71fae0152d0c19b7f4be77f37c021dd8eed","observation_id":"7c464923-91f2-4025-b754-ec05b9daf525","resolution":{"observed_at":"2026-08-05T23:33:22.596166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-08-05T23:33:19.656344Z","title":"Additionally, a discriminator is used solely for adver- sarial learning, which we will describe in Section 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.656344Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:ac2faec7a1689d3a6064cd0bd14ccdcbe5865b20e69d2561d1c9230e55d094a2","observation_id":"e200ab57-0403-4138-9ffa-c999d9a924c8","resolution":{"observed_at":"2026-08-05T23:33:19.656344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.354565Z","title":"Unlike [17], we do not use the wave-based discrimina- tor [18]","venue":null,"work_id":"eb2d7440-2011-4a42-a33d-8d125021a720","year":2048},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.659453Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:665a0e79596d034327595f9df928f79415808d8349a9304ff4832d92ff84bc1b","observation_id":"3f62aa91-0962-45fe-b91f-23e15d13c7da","resolution":{"observed_at":"2026-08-05T23:33:22.427339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.159455Z","title":"Both the generator and the discriminators are updated exactly once in each step","venue":null,"work_id":"437e814a-ec74-4a9c-a992-ab332dc4f879","year":null},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.662441Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:98b36323a8d2c638222f35d9c816010cb2a6d2b30d9bdd43bafafe5ae07631e3","observation_id":"e15ce3c1-5de2-44b4-8759-2a767f3afccd","resolution":{"observed_at":"2026-08-05T23:33:22.253700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.036886Z","title":"A key innovation of our model lies in its 2D con- volutional architecture, which operates directly on the time- frequency representation","venue":null,"work_id":"987883a1-ebbf-49cc-a843-1d4cdbf52405","year":null},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.665753Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:36696ce711454341d92acd318d60d681a48876b9ee3b16ceb20b4b630afea727","observation_id":"23c07c69-1ecf-4932-8924-20f963bafe2a","resolution":{"observed_at":"2026-08-05T23:33:22.093003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.851588Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"133af9b7-598e-4792-88bf-338907c6d475","year":2021},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.669589Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:437fc04eeadd629b38f9da6f7e769ed7d6fab0b2c911a232da0dab17e066e50f","observation_id":"e80fe371-4b62-44bb-b593-b5b970936ad7","resolution":{"observed_at":"2026-08-05T23:33:21.955459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.599014Z","title":"Audiolm: A language modeling ap- proach to audio generation,","venue":null,"work_id":"3b0c458b-39a3-42f7-8f9e-7031e6763827","year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.672459Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:cdbc5ef4ea92a4cd83a1b6bb9d03171c0446d1d2d92167d30cfcb09d9dd4f10f","observation_id":"1f36ce13-882b-425f-ae5c-70fcd1ea6d74","resolution":{"observed_at":"2026-08-05T23:33:21.705949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.675147Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.675147Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:0d829c4f9a35cac1d1bee77ff9c1558b20f84b4c239a46030ea5ef7b441a7919","observation_id":"0974b518-d5fd-417c-bc8d-33ecc50a4a36","resolution":{"observed_at":"2026-08-05T23:33:19.675147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.375943Z","title":"High-fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"eb48035d-1031-42b3-9698-b795dc4cdf53","year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.678169Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:5e119e3c969f160b8891f3471ec5d3942a819161a655214861afcdc7deb876a1","observation_id":"6f369632-7091-42a2-8800-300f7e21cf91","resolution":{"observed_at":"2026-08-05T23:33:21.497743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.129198Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"dabed8d6-c015-4f39-9359-f120717b593b","year":2024},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.681853Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:6ae2a7f4e7b1d68c6011346fde836c8efe011d122d392a07faa466cd5c05bf34","observation_id":"12464c7a-ba1f-41c0-b0ea-e66387278c50","resolution":{"observed_at":"2026-08-05T23:33:21.243096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.960248Z","title":"Fo- calcodec: Low-bitrate speech coding via focal modulation net- works,","venue":null,"work_id":"fcb9dc98-b4a1-46c0-9ed8-4e60710f3b64","year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.684989Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:6fd73e7258df17f3dc85e7fb55cfede690005c0740cd45443c3a79413f7ee176","observation_id":"bb9933dd-52c1-4bef-9e9a-c83a5b1990c1","resolution":{"observed_at":"2026-08-05T23:33:21.049575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.714575Z","title":"FlowDec: A flow- based full-band general audio codec with high percep- tual quality,","venue":null,"work_id":"e7631d80-7ea3-4166-a04a-8da76eb673b3","year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.687582Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:3d6cbbb68d8f76273a476baa2f9941276e5c426a1517a68731cc4865495ba741","observation_id":"48c297d5-4eef-4e5c-8b06-0843d46f1920","resolution":{"observed_at":"2026-08-05T23:33:20.816294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06720","last_updated":"2020-07-29T01:53:16Z","snapshot_observed_at":"2026-08-12T05:50:15.907244Z","submitted_at":"2020-05-14T05:05:22Z","title":"Streaming keyword spotting on mobile devices","version":2},"cited_work":{"arxiv_id":"2005.06720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.06720","snapshot_observed_at":"2026-08-05T23:33:19.808703Z","title":"Streaming keyword spotting on mobile devices","venue":"eess.AS","work_id":"5bde61b3-e78e-4c07-a0c5-bccd66a72752","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.690050Z"},"links":{"cited_paper":"/paper/2005.06720","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:7ceac05da00774e16fd772df72f4e0a631314a2bdbf1dfc5da37dd45896bb4a2","observation_id":"19f95d28-7696-4534-91b2-42480e7f4f32","resolution":{"observed_at":"2026-08-05T23:33:19.815592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.480886Z","title":"SEANet: A multi-modal speech enhancement network,","venue":null,"work_id":"66015496-bc6e-4674-b242-c02e44bd5159","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.693615Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:dbea625e2c79ce84a8b11125238a3172d06c86dbc004d48cad5541edf962f3c6","observation_id":"5cae8b5f-7a0e-4f59-ad40-b5d30cf1e953","resolution":{"observed_at":"2026-08-05T23:33:20.600843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-05T23:33:19.696010Z","title":"Soundstorm: Efficient parallel au- dio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.696010Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:88a0cb12ac9c361fb7ce445eb8d16bd13982e89287539140b2cfc87b15222459","observation_id":"7da8ff5b-219d-4922-ae0e-deb83331618f","resolution":{"observed_at":"2026-08-05T23:33:19.696010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04229","last_updated":"2024-02-06T18:36:52Z","snapshot_observed_at":"2026-08-09T21:01:01.945796Z","submitted_at":"2024-02-06T18:36:52Z","title":"MusicRL: Aligning Music Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04229","snapshot_observed_at":"2026-08-05T23:33:19.698892Z","title":"Musicrl: Aligning music generation to hu- man preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.698892Z"},"links":{"cited_paper":"/paper/2402.04229","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:0a43776a3817d9519a2163ddddc2e0f53141d68d5cbb7d55fb3fa7bca066847d","observation_id":"b7b7ff75-c35a-4ac1-9019-bee20efc893b","resolution":{"observed_at":"2026-08-05T23:33:19.698892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T23:33:19.701844Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.701844Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:e47e42b1494cdbc877e83b4b4ee21d4017724cc912814998d2f30ba7c3c7cbdb","observation_id":"7180966e-065d-4023-8728-156dd5dac211","resolution":{"observed_at":"2026-08-05T23:33:19.701844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.217463Z","title":"Weight normalization: A sim- ple reparameterization to accelerate training of deep neural net- works,","venue":null,"work_id":"de0e8b65-55ce-4932-a312-f3ed2d5bb947","year":2016},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.704661Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:bdd975ccaabed892fe811c7a6956d1c79fc8170c9ea4789383bcac3fe779472e","observation_id":"e92dc22c-4c24-4db6-bd5e-bdb9ecdf617c","resolution":{"observed_at":"2026-08-05T23:33:20.347269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T23:33:19.707384Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.707384Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:212652b0bc665d99b617ecc37e00ce4c7a14b0cecf9515c712a99c3df63a8ff5","observation_id":"34e3d981-dd61-4ef7-869e-521e64fb2f1a","resolution":{"observed_at":"2026-08-05T23:33:19.707384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.070553Z","title":"Fast and accurate deep network learning by exponential linear units (ELUs),","venue":null,"work_id":"91986d21-0000-4930-b4c2-a6f93c4d4e69","year":2016},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.710230Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:7a5801833d67193b337ae4470f613ee950df618f7651ca9c2f8f8ba7fbba81d1","observation_id":"2a4eb047-f888-49fc-a1f5-8bf3e860aac3","resolution":{"observed_at":"2026-08-05T23:33:20.126988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.950523Z","title":"Rectifier nonlinear- ities improve neural network acoustic models,","venue":null,"work_id":"b0e933eb-2e4a-49d0-aa0e-d7defc7e7d72","year":2013},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.713185Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:0b29f8704569425aa6dd86405c33557fd170840ae4c8745a9d31495db2d7c113","observation_id":"bd8da1e8-f09e-4cd0-a970-ec72d6bd0448","resolution":{"observed_at":"2026-08-05T23:33:19.992087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09584","last_updated":"2020-04-20T19:19:26Z","snapshot_observed_at":"2026-08-05T04:43:49.261929Z","submitted_at":"2020-04-20T19:19:26Z","title":"ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09584","snapshot_observed_at":"2026-08-05T23:33:19.737744Z","title":"Visqol v3: An open source production ready objective speech and audio metric,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.737744Z"},"links":{"cited_paper":"/paper/2004.09584","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:5a2328e3fea20994fab3023c6e6eaae7948722a2ed0847ad70dccb6eafba72ec","observation_id":"d8601910-cbbe-48a3-9f91-084b05f3dc41","resolution":{"observed_at":"2026-08-05T23:33:19.737744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.934442Z","title":"Mel- GAN: Generative adversarial networks for conditional wave- form synthesis,","venue":null,"work_id":"9f634464-5aad-43d1-af2e-bcda3c454cb4","year":2019},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.722201Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:f55432b580e40670878a391edbdb68d3d4a998c7616c310cc1b466ab079fa1e0","observation_id":"054d0725-59d0-462d-a96a-4a0e4b9694e8","resolution":{"observed_at":"2026-08-05T23:33:19.941283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.917616Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"56468745-fd98-4bcf-b16a-3965f7f93044","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.726088Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:a17d500fc811d6b99491e1be5939576896e6bb3692ab900db78517ffa0952b41","observation_id":"a266bad2-600b-4564-907e-04a530907fca","resolution":{"observed_at":"2026-08-05T23:33:19.922920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.901025Z","title":"Generative adversarial nets,","venue":null,"work_id":"1a3729dc-a29b-40bd-861f-fe350b4d2d3a","year":2014},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.729063Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:98f64d2826cae8d122472ace8de27cc68601ece0fff51fc1d4dea7aed4711f17","observation_id":"45ef31af-4c71-4aa4-ae12-89c02a060bf7","resolution":{"observed_at":"2026-08-05T23:33:19.907832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.884464Z","title":"A spectral energy distance for parallel speech synthesis,","venue":null,"work_id":"a8e5fd17-40ba-4777-86bb-8a5843da8c66","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.731868Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:195d5537707a945d0ee5367a21127f1aaa64534e59b71c6f471b547cf104e910","observation_id":"52fdf571-3564-4a2d-9612-49b1abf593a1","resolution":{"observed_at":"2026-08-05T23:33:19.889665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.867295Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"3f1ced3f-8888-4533-8318-d8b9c5efc345","year":2015},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.735039Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:4a696f864f350d40369dcf6b1be5ff6fa40132685a17910a207f33fd1664c2f6","observation_id":"055f1448-0dc3-4760-9cd1-9895f10f4850","resolution":{"observed_at":"2026-08-05T23:33:19.874354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.850881Z","title":"Visqol: The virtual speech quality objective listener,","venue":null,"work_id":"680a058a-0010-4be6-bff6-fc2abde247a1","year":2012},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.740508Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:2db65b83276d512afbb53617705fd051a9305fae49025607a13bbfedfe4a7944","observation_id":"b5b16f5f-dc56-4c85-8af2-c79286ac22f4","resolution":{"observed_at":"2026-08-05T23:33:19.855888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.830202Z","title":"The MUSDB18 corpus for music separation,","venue":null,"work_id":"e61385af-6077-495f-bbe1-1e0cc3d85ee0","year":2017},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.743287Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:0c29b28173db4c4e512dc9ab210ba607055e63711f222095351860818d395946","observation_id":"5d134de1-f0eb-4cca-b647-d575347d1f5f","resolution":{"observed_at":"2026-08-05T23:33:19.838150Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08933","last_updated":"2020-07-02T13:57:33Z","snapshot_observed_at":"2026-08-11T23:07:33.950739Z","submitted_at":"2020-02-20T18:30:36Z","title":"Wavesplit: End-to-End Speech Separation by Speaker Clustering","version":2},"cited_work":{"arxiv_id":"2002.08933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.08933","snapshot_observed_at":"2026-08-05T23:33:19.770354Z","title":"Wavesplit: End-to-End Speech Separation by Speaker Clustering","venue":"eess.AS","work_id":"92d74153-fdcd-430e-b002-f5ee33984c54","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.719206Z"},"links":{"cited_paper":"/paper/2002.08933","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:1a71e788a9d935979a6573ffd6dc544e7f2e9027251d74cbb96a4db1b4ed0284","observation_id":"c1c6205c-badc-4ad4-a03e-050f796a4e24","resolution":{"observed_at":"2026-08-05T23:33:19.776450Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T00:07:16.716989Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 4 inbound Pith citation observations for arXiv:2508.05207."}