{"as_of":"2026-08-19T22:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:858270cac0a3bd7f2a9d434224b1e4360c182d74279681a74b10c43fa68ba4e4","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:57:08.585678Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:57:08.411772Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-12T10:57:08.411772Z","title":"The encoder downsamples the time-domain audio to extract frame-wise au- dio features, typically with a frame rate of 12.5–100 Hz","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.411772Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:03782d200705069cbd53b489d61d470da0b438942cd35ee7c3f0270c7c0d5056","observation_id":"ce9606ef-0009-47e3-aa96-11b9790848c7","resolution":{"observed_at":"2026-08-12T10:57:08.411772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-11T05:20:45.109103Z","title":"In ICASSP’78","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-11T15:07:28.270038Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-11T05:20:45.109103Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2412.17667"},"observation_digest":"sha256:502c0971d97050328184674837083e2c971d487c71b534ff34b6ca89c8a41d2d","observation_id":"7e92ff0b-20a8-4813-adf0-9b726946a129","resolution":{"observed_at":"2026-08-11T05:20:45.109103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-10T20:34:37.557233Z","title":"Ts3-codec: Transformer- based simple streaming single codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08238","last_updated":"2026-06-05T17:32:46Z","snapshot_observed_at":"2026-08-17T22:34:27.630404Z","submitted_at":"2025-01-14T16:26:14Z","title":"CodecFake+: Codec-Based Resynthesized Data as a Proxy for Detecting CodecFake Speech","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:37.557233Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2501.08238"},"observation_digest":"sha256:035e2cc47fa91006d930e51174539973a59b295d9632e56f938abfcd2569b19d","observation_id":"4c2ab74e-6c20-497b-b9d0-8e18c6213b42","resolution":{"observed_at":"2026-08-10T20:34:37.557233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-07T14:58:42.579162Z","title":"TS3-Codec: Transformer-based simple streaming single codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-18T20:22:13.999663Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.579162Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:ed4bc2c79032af4203bce96f1c1dd8ba02a2ea3a4f4259a53b7e306543eaefc1","observation_id":"2a9b763d-c4eb-4e23-a9db-7766fc53a498","resolution":{"observed_at":"2026-08-07T14:58:42.579162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-07T12:12:29.788907Z","title":"Ts3-codec: Transformer-based simple streaming single codec.arXiv preprint arXiv:2411.18803,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00385","last_updated":"2025-05-31T04:31:02Z","snapshot_observed_at":"2026-08-12T05:59:14.233667Z","submitted_at":"2025-05-31T04:31:02Z","title":"MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:29.788907Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2506.00385"},"observation_digest":"sha256:ff91017d6b89b0a0093b192bf729a291d6feef23988f9ae4f6b2e71e211492b1","observation_id":"44e9ba0b-86d4-498a-9499-c63d4984ea96","resolution":{"observed_at":"2026-08-07T12:12:29.788907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T23:10:56.245021Z","title":"Ts3-codec: Transformer-based simple streaming single codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-15T19:37:24.068614Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.245021Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:f1950477b007db3e0104e8e8d23642ae519de7ad4f6c0c7d816e617033c808bd","observation_id":"57bf441b-e926-4c19-b4de-a6a7246a0672","resolution":{"observed_at":"2026-08-05T23:10:56.245021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-02T22:52:22.632593Z","title":"E., & Li, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15491","last_updated":"2026-07-27T12:16:11Z","snapshot_observed_at":"2026-08-19T14:26:16.222437Z","submitted_at":"2026-02-17T10:59:33Z","title":"The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:52:22.632593Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2602.15491"},"observation_digest":"sha256:d509973297b7711c764c9afdfd709cfe6573c479b14915f26ae5a5f52b175042","observation_id":"7286be21-0ff9-4929-aafc-2ba2bfab38dd","resolution":{"observed_at":"2026-08-02T22:52:22.632593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":"2411.18803","doi":"10.48550/arxiv.2411.18803","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"E., and Li, J","venue":"arXiv (Cornell University)","work_id":"2c14cc98-5e4e-4345-bcff-84f8d27c040a","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:611cedbab4b863fe805314dd61c1ba8de6ea68302dedef91a412354e3af5ee9e","observation_id":"6d73520c-6fd6-4b72-bfb5-016879fd6d54","resolution":{"observed_at":"2026-06-30T22:15:05.294432Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":"2411.18803","doi":"10.48550/arxiv.2411.18803","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"E., and Li, J","venue":"arXiv (Cornell University)","work_id":"2c14cc98-5e4e-4345-bcff-84f8d27c040a","year":2024},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-08-13T18:47:34.345492Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:c35b7906f6d5ced577129136990ff421c4e6a924ae82a95b9d7339fd08f0506e","observation_id":"ce90ef58-d24e-45bc-bf3c-dba558993043","resolution":{"observed_at":"2026-07-03T16:08:37.466186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":"2411.18803","doi":"10.48550/arxiv.2411.18803","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"E., and Li, J","venue":"arXiv (Cornell University)","work_id":"2c14cc98-5e4e-4345-bcff-84f8d27c040a","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:1336c6ccf4d1a35a7b8bafb61bbc6b18b56cab98b91463baceff1088dbe1be97","observation_id":"d8a3fcd6-77c0-4e52-836e-e3bd0298c8c2","resolution":{"observed_at":"2026-07-01T11:45:47.220487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":"2411.18803","doi":"10.48550/arxiv.2411.18803","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"E., and Li, J","venue":"arXiv (Cornell University)","work_id":"2c14cc98-5e4e-4345-bcff-84f8d27c040a","year":2024},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-12T13:34:06.515666Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:e1de9757ad4dfd558b6e37e5caeb9cf5296eb52ffe8f804bb14f3684e3ca028e","observation_id":"9bf6d11c-0b5f-4a07-9949-777d777b2bfd","resolution":{"observed_at":"2026-07-02T05:56:39.854827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.710538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2411.18803 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-08-13T01:04:17.839846Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:31c29dc4b6c1214cb14457ee5af25c5edcd51574484e27079abf803836e83321","observation_id":"37063fa0-30e7-4ff4-85bb-44f8139bce9e","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-07-30T11:48:49.526693Z","title":"Haibin Wu, Bach Viet Do, Naveen Suda, Julian Chan, C R Madhavan, Gene-Ping Yang, Yi-Chiao Wu, Naoyuki Kanda, Yossef Adi, Xin Lei, Yue Liu, Florian Metze, and Yuzong Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-08-17T17:56:26Z","snapshot_observed_at":"2026-08-19T21:24:46.820342Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.526693Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:202fb119442ef051bfa15cac09b98afc1f0a067295e6d539fbc908823486220f","observation_id":"e039e130-9fc9-4b33-afdd-ef05a5bfedf3","resolution":{"observed_at":"2026-07-30T11:48:49.526693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-10T04:20:42.277492Z","title":"arXiv preprint arXiv:2411.18803 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07462","last_updated":"2026-08-07T17:57:45Z","snapshot_observed_at":"2026-08-19T16:31:52.529349Z","submitted_at":"2026-08-07T17:57:45Z","title":"SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-10T04:20:42.277492Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2608.07462"},"observation_digest":"sha256:6d261a92ccc92e0a083c8f29792724df5a1cf6781d5d8870ac337ec9615eed7e","observation_id":"a2864ae6-a1c0-4587-8414-6d830c794d93","resolution":{"observed_at":"2026-08-10T04:20:42.277492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18803/citation-record","integrity":"/paper/2411.18803/integrity","json":"/paper/2411.18803/citation-record.json","paper":"/paper/2411.18803"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:09.049414Z","title":"More recently, NAC has also gained significant attention as a key technology for speech lan- guage modeling (SLM) [6–8]","venue":null,"work_id":"13d37ae8-8ea5-45b7-9be8-7d6310bc00a0","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.407044Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:be3eb673cebc07b636e2166c6b60fa5ba248b0351a49bd1271ed4525e62c5eb4","observation_id":"5858faed-d0f9-4fd3-a147-a2e5965c08f6","resolution":{"observed_at":"2026-08-12T10:57:09.053466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-12T10:57:08.411772Z","title":"The encoder downsamples the time-domain audio to extract frame-wise au- dio features, typically with a frame rate of 12.5–100 Hz","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.411772Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:03782d200705069cbd53b489d61d470da0b438942cd35ee7c3f0270c7c0d5056","observation_id":"ce9606ef-0009-47e3-aa96-11b9790848c7","resolution":{"observed_at":"2026-08-12T10:57:08.411772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:09.026067Z","title":"×$ ℝ%×$ Reshape Linear wo bias Linear… Transformer×𝑁ℝ%×$LinearVQLinear Transformer×𝑁 Linear Linear wo bias … ℝ!ℝ","venue":null,"work_id":"f7b06c3a-4d41-4312-84cf-08b1e7b46c5e","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.420274Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:c68155d6d429ccddc06e543755a5d8baf5ac446870b2099b1ba9a352443ee4b6","observation_id":"34c2eb9b-37db-4ab5-8eab-056bfcb5245d","resolution":{"observed_at":"2026-08-12T10:57:09.030059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:09.013675Z","title":"Data We used Libri-light [31], which contains 60K hours of speech, to train the codec models","venue":null,"work_id":"a19d4025-49bd-44e2-9df2-28d568217323","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.425422Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:60436f54f93a95c62f1d60fee3989dc23da3f0062c260abdca7ad4c8baf02c21","observation_id":"288e723a-bb46-42ff-9548-14925d1e624b","resolution":{"observed_at":"2026-08-12T10:57:09.017614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:09.001606Z","title":"Results at approximately 1000 bps In Table 3, four non-streaming baselines, (A)–(D1), are evalu- ated using results derived from their official checkpoints","venue":null,"work_id":"a887847f-df77-4a3c-a005-f811c9c1f373","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.429872Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:4e768d8ab540bae851aa932597cb99a62fa9e2445e7f569ea6552ee51b9664a7","observation_id":"2fb71e1d-77ab-4972-bff4-07635046be0d","resolution":{"observed_at":"2026-08-12T10:57:09.005848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.990323Z","title":null,"venue":null,"work_id":"35ccb87d-d9d8-4c95-be92-5af2355375d7","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.433935Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:6ad9462470e1795c516f9538df857518e666b9590333335b46cc2711dc718393","observation_id":"24eb8eea-149c-4150-941d-9315dbb79bc5","resolution":{"observed_at":"2026-08-12T10:57:08.994282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T10:57:08.465887Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.465887Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:4df80aced5da1ab1f375e2a90ef316d1bce531f3e5d8ca5ceb08891728b1de88","observation_id":"9b85f422-0d74-4b25-baab-62c3835eaba7","resolution":{"observed_at":"2026-08-12T10:57:08.465887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06954","last_updated":"2025-01-07T04:11:55Z","snapshot_observed_at":"2026-08-17T23:34:11.375885Z","submitted_at":"2024-08-13T15:13:21Z","title":"Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs","version":2},"cited_work":{"arxiv_id":"2408.06954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.06954","snapshot_observed_at":"2026-08-12T10:57:08.784131Z","title":"Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs","venue":"cs.SD","work_id":"97c46196-fef7-4ecb-b80e-5ef44bfd49bc","year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.438249Z"},"links":{"cited_paper":"/paper/2408.06954","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:f79ab762ac522f6c4080d0f1e48b782a71e4196e00e14502d4311bc80aba4984","observation_id":"349ebc89-39fe-43ad-aeb6-04bb32fa01c9","resolution":{"observed_at":"2026-08-12T10:57:08.790349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.978521Z","title":"Codec-SUPERB: An in- depth analysis of sound codec models,","venue":null,"work_id":"c54ce995-4c5f-4c8d-821c-0db86e2a0e4a","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.442190Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:cc58ee65bde8753342bd57f8fdc077caf844e16e7ac509c94a237faded429d9e","observation_id":"85ca8b2f-ac7d-4155-aa80-3bc03484ee65","resolution":{"observed_at":"2026-08-12T10:57:08.982704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:09.037773Z","title":null,"venue":null,"work_id":"8cbfa0b8-693c-47a0-8fa5-b4fff20838d1","year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.416189Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:c2591ade62cac293cff45c73ef21f4856e09ca1af7b515b6d81bf47b71dc1f02","observation_id":"c928f62e-8c07-4576-b5a4-01071c20d108","resolution":{"observed_at":"2026-08-12T10:57:09.042041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15897","last_updated":"2025-02-24T18:34:41Z","snapshot_observed_at":"2026-08-18T10:40:37.420100Z","submitted_at":"2024-09-24T09:16:11Z","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15897","snapshot_observed_at":"2026-08-12T10:57:08.449289Z","title":"Espnet-codec: Compre- hensive training and evaluation of neural codecs for audio, music, and speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.449289Z"},"links":{"cited_paper":"/paper/2409.15897","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:893bfd86cac3523e224fe5609a09c9202163954c8233e4bc7f62fff11d145907","observation_id":"ed60375e-15fe-446a-be80-5f813c7d875b","resolution":{"observed_at":"2026-08-12T10:57:08.449289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14085","last_updated":"2024-09-21T09:39:36Z","snapshot_observed_at":"2026-08-16T13:16:40.117842Z","submitted_at":"2024-09-21T09:39:36Z","title":"Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14085","snapshot_observed_at":"2026-08-12T10:57:08.453711Z","title":"Codec-superb@ slt 2024: A lightweight benchmark for neural audio codec models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.453711Z"},"links":{"cited_paper":"/paper/2409.14085","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:b3d52d7f56c38bab34868ab463b2b89b036cedb739ac749a2f2372af8acdb262","observation_id":"aef4a325-8c43-4b9d-ab4e-14c701d41429","resolution":{"observed_at":"2026-08-12T10:57:08.453711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-08-18T09:59:43.769988Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-12T10:57:08.458050Z","title":"Dasb–discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.458050Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:a60408231dc142d53aa7cd7ca117e8f794acbdee763981ce7020eea0b3ccaba9","observation_id":"fb057fa8-24be-4d34-bfd2-6d0ca68d5d12","resolution":{"observed_at":"2026-08-12T10:57:08.458050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.462411Z","title":"Audiolm: a language modeling approach to audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.462411Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:46089f021fecb5300ab177c6c40b3ddd2ac7556c24d398d4aba9a54d0f94d1ca","observation_id":"0a6fa24d-2e3b-4778-bbeb-8d48f7b34477","resolution":{"observed_at":"2026-08-12T10:57:08.462411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T10:57:08.495784Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.495784Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:3a333658a7ed75a7d97aac2f7afeb70e71b0d24a12490f0f74d5ba387be2ebe8","observation_id":"1656a58b-11b7-484f-ae08-684dcdd68016","resolution":{"observed_at":"2026-08-12T10:57:08.495784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.469717Z","title":"Speechx: Neural codec language model as a versatile speech transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.469717Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:5a17550368de80b82ac57302d695e002095d69a5f5ebe01207bb2283abff284f","observation_id":"5dc18737-b3e1-4455-9e1a-ba231dbbe099","resolution":{"observed_at":"2026-08-12T10:57:08.469717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-16T14:16:50.961019Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-12T10:57:08.473295Z","title":"Towards audio language modeling-an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.473295Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:92f4e1b351184a971fdd1c02aad45f25f15e885ae03f6c1211019289ebf5452f","observation_id":"8de55c88-5d75-4d67-91d6-d5eb02a00c56","resolution":{"observed_at":"2026-08-12T10:57:08.473295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-12T10:57:08.477120Z","title":"Wavtokenizer: an efficient acous- tic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.477120Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:777eb77b12179bd78a5a64d847154111f4ee2a76f078cf111ca41bfc6ef32d4a","observation_id":"14334fd2-b27d-4b1c-b5b2-eb537ce818ef","resolution":{"observed_at":"2026-08-12T10:57:08.477120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-12T10:57:08.480919Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.480919Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:0913440a28fa5ce13734ef6b4d9140e08e8f1771fe90900862e97b183c24638f","observation_id":"0f72f1b6-81aa-4f58-b6e5-885382d838eb","resolution":{"observed_at":"2026-08-12T10:57:08.480919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.484715Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.484715Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:e7e8e12f681435d8538102b36e16da8137ccdab668001ba78ab29bf68cfba3cc","observation_id":"886a9bf3-e4b2-49d4-8e99-759df1288a38","resolution":{"observed_at":"2026-08-12T10:57:08.484715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.934486Z","title":"Generative spoken dialogue language model- ing,","venue":null,"work_id":"86c4d457-e635-44c8-8997-ee40b558d3fa","year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.488547Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:fde435a73ff286633abd1efe6486b6726c576d14868822a6b57c49f7273704a6","observation_id":"5f92d1e9-d342-47f9-ab00-a82735606edd","resolution":{"observed_at":"2026-08-12T10:57:08.938658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.492227Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.492227Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:38e841f85eacd7050b5e9f03392fd2b6794b94ef8182780fa4d680fdb6a7d874","observation_id":"ec55d800-033f-4148-9ac1-3eedf702ae83","resolution":{"observed_at":"2026-08-12T10:57:08.492227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-18T17:50:53.134857Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-12T10:57:08.526943Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.526943Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:b226ad984c7bddc81c0488fe5f993caf6fbca52fbf0e8a40d260bf834d09533f","observation_id":"82e50c85-551c-4381-b35f-509eeb55e5c5","resolution":{"observed_at":"2026-08-12T10:57:08.526943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.914968Z","title":"Megabyte: Predicting million-byte sequences with multiscale transformers,","venue":null,"work_id":"ef162e29-ff8b-4348-b30c-6b207c860e76","year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.500219Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:7ac833199b4be3bf9757d51512129a625bf963ed1e51ab6b500a853b39e78615","observation_id":"e0334ebb-d1cb-44c9-9e57-6426f51b4923","resolution":{"observed_at":"2026-08-12T10:57:08.918930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-12T10:57:08.503701Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.503701Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:0f42a5b7276335c378c08cf0b70d7c8a0ff7d314a0068b207fae4c232551bbdd","observation_id":"7cc2410c-b149-4fa1-80df-2c899d75e363","resolution":{"observed_at":"2026-08-12T10:57:08.503701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.507412Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.507412Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:883aebdf7d393e9b49aabdab704e5158ea4a13c6ad53d7f46f7f4d4b0621be0e","observation_id":"6b571bb1-3d94-4493-b85e-8db59f2cee88","resolution":{"observed_at":"2026-08-12T10:57:08.507412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-12T10:57:08.511006Z","title":"Fi- nite scalar quantization: Vq-vae made simple,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.511006Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:70e6e5a0ff749fabf527b09ade0c617ffb747d0fdcf13bb67a1af36e01cabd92","observation_id":"0a98529b-4178-4e69-8da9-5e43266d3af6","resolution":{"observed_at":"2026-08-12T10:57:08.511006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.515013Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.515013Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:7f2e087e6f976de55c8e1a1b41e0064cfa079877f63aa0d4a7a0a623d6d86215","observation_id":"9dbba404-9a39-439e-bb70-e91b0ac0aa4c","resolution":{"observed_at":"2026-08-12T10:57:08.515013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.518825Z","title":"Fewer-token neural speech codec with time-invariant codes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.518825Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:1bcfa223a80984f3d0a001a1b0bafc79783b3e096e5d7db60c3887544495464a","observation_id":"23e996a2-d719-408c-8203-d67e5d551bc3","resolution":{"observed_at":"2026-08-12T10:57:08.518825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-19T21:21:21.739389Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-12T10:57:08.522475Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.522475Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:ec8e86a326d6ac0c559f1ded31a6b50862271b7bc01444ac9814f10e56d95bea","observation_id":"964049ae-5ea3-443f-ba70-c597ba79495e","resolution":{"observed_at":"2026-08-12T10:57:08.522475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.558540Z","title":"Libri-light: A benchmark for asr with limited or no su- pervision,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.558540Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:7a04e09c1b41ccc573f7860f7371ae217d6e4453baca5446f92e43abf4263246","observation_id":"9a4cb872-e2b1-4db7-9d44-2f0e713834cb","resolution":{"observed_at":"2026-08-12T10:57:08.558540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-16T20:32:23.736592Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-12T10:57:08.531814Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.531814Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:b3c98836bd64c1c1e1d99d7bd3ee18719f7b10fd874e06ab72b793d8ef8b5591","observation_id":"4f77f30a-3f52-42c9-844a-8bcc67f0ff31","resolution":{"observed_at":"2026-08-12T10:57:08.531814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.535829Z","title":"Audiodec: An open-source streaming high-fidelity neural audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.535829Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:d7c0dca717d67649d2bfe636dba8680a0125879283fd861d1a57036c789051ac","observation_id":"058056cb-64e6-4fd9-95ac-33f00792eb7e","resolution":{"observed_at":"2026-08-12T10:57:08.535829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.539429Z","title":"Generative adver- sarial networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.539429Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:029234bf1105dad47dcae7191889d50788da421885ee9916714a5183b0aee97c","observation_id":"7777f2a1-0827-4311-b178-b999106dafc8","resolution":{"observed_at":"2026-08-12T10:57:08.539429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.869010Z","title":"Wavenext: Convnext-based fast neural vocoder without istft layer,","venue":null,"work_id":"129b8131-fac4-4a2f-8017-69b1da3dd98d","year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.543236Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:378ce5aa6b735cc16ad8a8afb01d0ad71d50b127e1d76cc1585a32e182b59f57","observation_id":"c51ef002-fbe8-4b5e-b0ad-c34f8701198b","resolution":{"observed_at":"2026-08-12T10:57:08.872782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.857936Z","title":"Hearing the agi from gmm hmm to gpt 4o,","venue":null,"work_id":"acf9311c-a632-4538-aecb-25830b31944d","year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.547214Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:977f460375fd788e7669ecd5015f20f9a05b62e62fde5c52544e26e0ce101230","observation_id":"4dcbd1b9-616b-45c4-82ca-24a2c7936b0c","resolution":{"observed_at":"2026-08-12T10:57:08.861778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.551074Z","title":"Least squares generative adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.551074Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:8c1df74e1b7e07d86a61d84d5f8a2950c791fba058c44ab65e513bfb7f04f3b2","observation_id":"86d2ad6d-d0f3-4d3f-b6ff-d6c7fd564f78","resolution":{"observed_at":"2026-08-12T10:57:08.551074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.554994Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.554994Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:4d4c5d89d27dfe7909e99daf9a9969c2b6d4c9709aaa8dd9d39cbfe706ede72d","observation_id":"3a538afc-1f5c-4e75-9212-3ea4ae59a956","resolution":{"observed_at":"2026-08-12T10:57:08.554994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.562296Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.562296Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:530fe02f4c092ab801ec18049e5075362748af7d9c747da9fbcaa2ac801a8b3e","observation_id":"960b2538-641b-44bf-b026-17260c3c3c7a","resolution":{"observed_at":"2026-08-12T10:57:08.562296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.566645Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.566645Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:5fb0cde0d40b23a1f7e9ed341b13b5538ee0a1ad755dcb99169b3fe175cb6f24","observation_id":"93a798c7-0f5a-4b44-a044-883a621d5303","resolution":{"observed_at":"2026-08-12T10:57:08.566645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.570227Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.570227Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:31b72286bf1a8026f8cf7000e7c5803c012b6733de35e7f8c01a2a7271b6fdfb","observation_id":"3dd273e6-f780-4311-8eca-3f0316993b0a","resolution":{"observed_at":"2026-08-12T10:57:08.570227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-18T07:24:35.277244Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-12T10:57:08.573932Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.573932Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:386308bc0ad82ee22ccd52463845080d2c7bb104c4b2e15efd948523eab8ecab","observation_id":"fdc4aa58-a145-4680-adda-f2862d74942d","resolution":{"observed_at":"2026-08-12T10:57:08.573932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.577980Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.577980Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:766bb47075c3b6957db7e899afaa5c3d77daae40ee7bf8f566535ba13fe5b5da","observation_id":"8c1a0ad4-17ad-47b0-b029-4e1ffea2865a","resolution":{"observed_at":"2026-08-12T10:57:08.577980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-12T10:57:08.581775Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.581775Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:8d6df108bc915d64089218650c763513b75086f54dde9335eacaab1df7b275a2","observation_id":"897055d0-ae01-412e-bf1c-55cb48a63822","resolution":{"observed_at":"2026-08-12T10:57:08.581775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T10:57:08.585678Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.585678Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:beed293c949e958e74528714e70970f96505afa7bcd83b724ed8ba9c750a4ddc","observation_id":"ca6ec73c-5731-4232-84d1-cda269f1e99f","resolution":{"observed_at":"2026-08-12T10:57:08.585678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:57:08.966363Z","title":"2024, pp","venue":null,"work_id":"33e309c1-3fbe-40c3-89ae-1ac4202eca55","year":2024},"citing_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T10:57:08.445729Z"},"links":{"citing_paper":"/paper/2411.18803"},"observation_digest":"sha256:4430e228e47a231c1f5c6d625f446cf3e23cb8e44574ba6028dac34d8a383df2","observation_id":"3254b6cc-fd1e-4cd1-b69d-b1dddc3c1574","resolution":{"observed_at":"2026-08-12T10:57:08.970140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T16:49:09.731359Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 14 inbound Pith citation observations for arXiv:2411.18803."}