{"as_of":"2026-08-10T03:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e01ab6f1b776b273215307d7d6890623184939cff6eb6b4e640a6ef5c6855ca3","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:43.768535Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:38.985414Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T11:45:47.096163Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16845","snapshot_observed_at":"2026-08-07T14:58:38.985414Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:38.985414Z"},"links":{"cited_paper":"/paper/2505.16845","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:f1aa71a31a970a7a57ae8186ec1493c02cec81353966c80dc125612e3846dff8","observation_id":"e72fce43-c3f4-4ef1-9a29-1ace7b4b824c","resolution":{"observed_at":"2026-08-07T14:58:38.985414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"cited_work":{"arxiv_id":"2505.16845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16845","snapshot_observed_at":"2026-07-01T11:45:47.096163Z","title":"arXiv preprint arXiv:2505.16845 , year=","venue":null,"work_id":"a016fdf4-0db1-418d-838d-3e767f6bdb8b","year":2025},"citing_paper":{"arxiv_id":"2606.29480","last_updated":"2026-06-28T16:17:37Z","snapshot_observed_at":"2026-08-05T19:07:29.935910Z","submitted_at":"2026-06-28T16:17:37Z","title":"DTM-Codec: Dynamic Token Masking for VFR Speech Coding with Efficient Boundary Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T02:10:08.691873Z"},"links":{"cited_paper":"/paper/2505.16845","citing_paper":"/paper/2606.29480"},"observation_digest":"sha256:25adfa9f3f982831d5538e631667559605c0d70f8c3bba9bf3ca1b0d564d2de6","observation_id":"84ce99e9-4ae0-46d2-be8d-47c0a6cf0d2c","resolution":{"observed_at":"2026-06-30T02:14:11.521844Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"cited_work":{"arxiv_id":"2505.16845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16845","snapshot_observed_at":"2026-07-01T11:45:47.096163Z","title":"arXiv preprint arXiv:2505.16845 , year=","venue":null,"work_id":"a016fdf4-0db1-418d-838d-3e767f6bdb8b","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2505.16845","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:db6a83826132d4529a069cd5f4c6e9eaba85aa0662f49bb708cf58d86b05c991","observation_id":"dff4a97a-4744-4bc2-9d46-8ecdd3e2666f","resolution":{"observed_at":"2026-07-01T11:45:47.098139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16845/citation-record","integrity":"/paper/2505.16845/integrity","json":"/paper/2505.16845/citation-record.json","paper":"/paper/2505.16845"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:49.487092Z","title":null,"venue":null,"work_id":"a9f276e4-4c89-45fd-b3f8-ead5c097e990","year":null},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:38.925017Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:03e902dc2177201e83fae314c8b50b220204de2c6b35a5e8989d7935549a213d","observation_id":"c83d7c9c-9dd4-40e3-9c66-7e595302a159","resolution":{"observed_at":"2026-08-07T14:58:49.620935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16845","snapshot_observed_at":"2026-08-07T14:58:38.985414Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:38.985414Z"},"links":{"cited_paper":"/paper/2505.16845","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:f1aa71a31a970a7a57ae8186ec1493c02cec81353966c80dc125612e3846dff8","observation_id":"e72fce43-c3f4-4ef1-9a29-1ace7b4b824c","resolution":{"observed_at":"2026-08-07T14:58:38.985414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:49.242983Z","title":"diffusing","venue":null,"work_id":"4e660a5e-b455-4409-8153-9bc6c22cb70b","year":null},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.107273Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:7cec2abed49d9bab92162c958710d31de8ce3aa91f9aaa7b3d9686d45e30aa06","observation_id":"80bce419-9fe9-409c-bb1e-574dbd31be80","resolution":{"observed_at":"2026-08-07T14:58:49.373197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:48.978877Z","title":"Architecture and Setup We implement TFC upon the DAC [3] backbone, which achieves high-fidelity reconstruction performance among vari- ous existing codecs [30]","venue":null,"work_id":"85a9bc40-838c-420b-a20a-44547682e292","year":null},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.212796Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:e1ecbeba6f46e34bd24c2b540b650f4a947c8b2adf093ac25733f54ff12aad3b","observation_id":"3a1f270e-216e-4aed-badf-0e0c75861413","resolution":{"observed_at":"2026-08-07T14:58:49.114744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:48.727372Z","title":"TFC effectively balances bitrate and audio quality while reducing sequence length","venue":null,"work_id":"93af14b5-3a8c-4ec8-82ab-0ed1cd41a1d4","year":null},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.337952Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:198d1368e5527dcfe0fe39407fbff0693c0f92e7d1a193686af0bd33e12066ae","observation_id":"06ccbd21-678a-4837-8f16-523dbf20bf1f","resolution":{"observed_at":"2026-08-07T14:58:48.858403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:39.459941Z","title":"92370206), the Shanghai Municipal Science and Technol- ogy Major Project (2021SHZDZX0102) and the Key Re- search and Development Program of Jiangsu Province, China (No.BE2022059)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.459941Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:9d56aa3dc88d6f6b874fe27f72b3f902b856e229a1af69c2ad7c67c02e8f4c0e","observation_id":"4ab44152-7d48-4836-a3e7-fdd2f03ba5d3","resolution":{"observed_at":"2026-08-07T14:58:39.459941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:48.444047Z","title":"SoundStream: An End- to-End Neural Audio Codec,","venue":null,"work_id":"fbb87553-b920-4274-b9b2-7ba0e9304962","year":2021},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.622742Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:f7846d6f705ebbd3c5de7e2afd72f1125c8e495ce99b9d6b7ce6aaabafc77e66","observation_id":"450e4bfe-f3f1-4f7b-84bc-0034fe7c7375","resolution":{"observed_at":"2026-08-07T14:58:48.569022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:39.739080Z","title":"High Fidelity Neu- ral Audio Compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.739080Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:ff0865deb88636ee39fecbf2645d723a1e92e1e5aec3a7a74ada3014083e8a60","observation_id":"1c7e0f59-fa81-41f4-9a76-c76ddbe698e9","resolution":{"observed_at":"2026-08-07T14:58:39.739080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:48.156205Z","title":"High-Fidelity Audio Compression with Improved RVQGAN,","venue":null,"work_id":"3a526995-3554-4c04-abfd-1280244fb680","year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.856451Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:f7f0fdcd278d846d1f0f014d69bd14977699735fb39a8cc7e7ef7351a4b2c408","observation_id":"1f642159-1c37-4767-af73-53a71146b374","resolution":{"observed_at":"2026-08-07T14:58:48.299739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:47.897261Z","title":"AudioLM: A Language Modeling Approach to Audio Generation,","venue":null,"work_id":"0b2edae6-5ea7-407b-9523-fcd8421b5888","year":2023},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:39.994038Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:5914ff5b6c944c9bc2113ad7fd915b1c02a2b18da60dc04131f2b88af9b91b4e","observation_id":"c6406b8b-fef6-4122-ae84-de9a5c857722","resolution":{"observed_at":"2026-08-07T14:58:48.015541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:47.680968Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":"3e5cf4b3-63e2-4af3-b46f-616c0a5663c8","year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.142216Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:0842b4d6e1c77a870f7469f3e7e2b7c036cb8ad23daff3faf8b930e4c8c9a861","observation_id":"8178f4a0-6809-4faa-a187-e3b05c74cc23","resolution":{"observed_at":"2026-08-07T14:58:47.795638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:47.448781Z","title":"Neural machine transla- tion of rare words with subword units,","venue":null,"work_id":"91b777e6-7726-4671-80dd-ef67dfea2a75","year":2016},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.283921Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:1c4af550269cea6ba50ff11d9a387fcea93af6f3661848cfe2b92484c31f89e8","observation_id":"2460bce6-741b-488f-bf1b-8203fcc846b5","resolution":{"observed_at":"2026-08-07T14:58:47.544263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:40.422225Z","title":"Why Do Speech Lan- guage Models Fail to Generate Semantically Coherent Out- puts? A Modality Evolving Perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.422225Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:c1041d5a9a4d7a83d1bfc6de7e202fa3d50d80fc56d30c3a5c26b4c5607be529","observation_id":"696477e0-c302-4aed-b1b1-dcab78185be6","resolution":{"observed_at":"2026-08-07T14:58:40.422225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T14:58:40.546152Z","title":"V ALL-E 2: Neural codec language models are hu- man parity zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.546152Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:94b8eebcab66d2f3080d85aeeb2c4a102794677267dd8bcef9853d905595a325","observation_id":"91e21a39-50cf-492f-a160-8d31e37592d9","resolution":{"observed_at":"2026-08-07T14:58:40.546152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:47.222733Z","title":"TacoLM: Gated attention equipped codec language model are efficient zero-shot text to speech synthesizers,","venue":null,"work_id":"6c0e9323-c119-416d-a8fa-4271ae0488e4","year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.652442Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:a034b1aada7fff71aa204a1b70e74ec23617033a206dcadfca8473a10e38a585","observation_id":"2b4514b4-82de-4b61-ad62-423213a3d47f","resolution":{"observed_at":"2026-08-07T14:58:47.334720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:46.978300Z","title":"Fast and high- quality auto-regressive speech synthesis via speculative decod- ing,","venue":null,"work_id":"ddd5a682-fea6-4b62-b7f8-00c5b89a2fb1","year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.782907Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:05580e1163ad8b886abd194826c1aacc8fef36d12ff61f3028a6df49737f7748","observation_id":"cd0880e0-b27e-412b-a579-9cad9d67d6d5","resolution":{"observed_at":"2026-08-07T14:58:47.110572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12117","last_updated":"2024-09-18T16:39:10Z","snapshot_observed_at":"2026-08-05T08:42:30.244745Z","submitted_at":"2024-09-18T16:39:10Z","title":"Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12117","snapshot_observed_at":"2026-08-07T14:58:40.913696Z","title":"Low Frame-Rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:40.913696Z"},"links":{"cited_paper":"/paper/2409.12117","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:3816b12ed9f2f3aa92d79fff212d7fc6aa3be201907c303ce1ceb4d26db002de","observation_id":"602f9e84-2e3a-4c5b-a3a8-641e2c567c01","resolution":{"observed_at":"2026-08-07T14:58:40.913696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:58:41.075677Z","title":"Moshi: A Speech- Text Foundation Model for Real-Time Dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.075677Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:bc1afc0474d7abccbc094c612183a7e4c0abccecffd1bcda1b2aaf48fda4edfb","observation_id":"976f5427-d911-4a1f-b386-3e114a6c765f","resolution":{"observed_at":"2026-08-07T14:58:41.075677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:41.205886Z","title":"SemantiCodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.205886Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:fff1d38509fb5a593ac0635b2555aab42cb9b4f81abbeb9ed42e2e3af1a85c55","observation_id":"36184609-8968-4181-942c-c75fbf892642","resolution":{"observed_at":"2026-08-07T14:58:41.205886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:46.753181Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Model- ing,","venue":null,"work_id":"a5981618-6dcf-47d1-b570-0b4862a94e0f","year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.362396Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:583152d52aa0e05320980a47e16377caa9247e18d879e6a08505f50de3922544","observation_id":"5c2999c8-6462-434c-82d6-6690c75d3b17","resolution":{"observed_at":"2026-08-07T14:58:46.830465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:46.520461Z","title":"Scaling transformers for low-bitrate high-quality speech coding,","venue":null,"work_id":"1ed4d19c-0a01-454e-9b85-fa4edf4cb585","year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.552998Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:e40344364c408fa6fdfffc55f73c9379fb853e4b4fe3a2e7a19bc937cf3afa9d","observation_id":"74d04d85-2d62-4a1e-b83d-d205bf237d90","resolution":{"observed_at":"2026-08-07T14:58:46.618938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06016","last_updated":"2025-04-27T15:10:16Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T13:18:24Z","title":"Variable Bitrate Residual Vector Quantization for Audio Coding","version":3},"cited_work":{"arxiv_id":"2410.06016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06016","snapshot_observed_at":"2026-08-07T14:58:43.931907Z","title":"Variable Bitrate Residual Vector Quantization for Audio Coding","venue":"cs.SD","work_id":"79f5436f-03a2-41ea-93a1-fcd70f396e0b","year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.712350Z"},"links":{"cited_paper":"/paper/2410.06016","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:16c0838a8053064c6f5edd147806db8ef1e387f57e94c9f7b15689a36a3f73f1","observation_id":"9a835e94-12f9-44ce-9468-d52baaf5ca7c","resolution":{"observed_at":"2026-08-07T14:58:44.040768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:46.283418Z","title":"Once-for-all: Controllable generative image compression with dynamic granu- larity adaption,","venue":null,"work_id":"c0f219bb-10dd-4b0c-9fe1-767e183733c1","year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.843228Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:0f23fa235de636a34d7855f18a133f2e0f7eba2ea6e8131fc05d5e8cdd8bb585","observation_id":"d7cc8ffc-fdc4-40cd-8310-5a58fe9db761","resolution":{"observed_at":"2026-08-07T14:58:46.407087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:45.970616Z","title":"Entropy-based variable frame rate analysis of speech signals and its application to ASR,","venue":null,"work_id":"9d53f996-d0e0-4122-b79e-84633da6e109","year":2004},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:41.962571Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:b27a182c13c878ad91288f436281265ee8b45b71f6610537a75284c1cda62422","observation_id":"bf1ea521-221c-4367-ac08-b862473f4712","resolution":{"observed_at":"2026-08-07T14:58:46.125223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:45.780525Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation,","venue":null,"work_id":"fd25168f-0bb7-4769-bb38-2b7d357683a5","year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.066054Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:073b1956840979a1045c2854367986ee06cd43ae141ffb934b456d2ea35edce6","observation_id":"415c0605-ea32-4d78-a649-881ec522a874","resolution":{"observed_at":"2026-08-07T14:58:45.859253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15764","last_updated":"2025-05-21T16:46:32Z","snapshot_observed_at":"2026-07-06T19:36:54.626904Z","submitted_at":"2024-10-21T08:23:31Z","title":"LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15764","snapshot_observed_at":"2026-08-07T14:58:42.180534Z","title":"LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.180534Z"},"links":{"cited_paper":"/paper/2410.15764","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:73dca8793e01191c775aad2f49fe695f6b12303ad47af6d2d9eb9e259fa4098c","observation_id":"bc6a4392-2486-4113-b886-6e6c6f713c95","resolution":{"observed_at":"2026-08-07T14:58:42.180534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14411","last_updated":"2024-10-18T12:24:05Z","snapshot_observed_at":"2026-08-06T22:31:38.899089Z","submitted_at":"2024-10-18T12:24:05Z","title":"SNAC: Multi-Scale Neural Audio Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14411","snapshot_observed_at":"2026-08-07T14:58:42.296314Z","title":"SNAC: Multi- Scale Neural Audio Codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.296314Z"},"links":{"cited_paper":"/paper/2410.14411","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:70c84b6cff1db31aec0ccc9fee90f47d30c218c5b9b04d51c3c6d60dc7a612bb","observation_id":"ca4962f9-1260-413b-87c2-404e66ba9e8d","resolution":{"observed_at":"2026-08-07T14:58:42.296314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11630","last_updated":"2024-09-18T01:31:19Z","snapshot_observed_at":"2026-07-06T19:17:19.354772Z","submitted_at":"2024-09-18T01:31:19Z","title":"Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11630","snapshot_observed_at":"2026-08-07T14:58:42.435189Z","title":"Speaking from coarse to fine: Improving neural codec language model via multi-scale speech coding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.435189Z"},"links":{"cited_paper":"/paper/2409.11630","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:15c57257e410ed1654d659a4c59e987e45e2014ea124bded7d3792b3e6f5ca1a","observation_id":"04ed4cb8-dffd-4576-878f-8ac7c4ed2492","resolution":{"observed_at":"2026-08-07T14:58:42.435189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-06T16:58:49.935180Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-07T14:58:42.579162Z","title":"TS3-Codec: Transformer-based simple streaming single codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.579162Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:08dd9f95bb68d8da7b8edc6ce5cd707b3be4e7381c931e0c21c9682bd6a8440f","observation_id":"2a9b763d-c4eb-4e23-a9db-7766fc53a498","resolution":{"observed_at":"2026-08-07T14:58:42.579162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T14:58:42.689387Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.689387Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:a59bf2eaea4fcd8dfd55b309ccacfe506cd04a98088f15efb6390b96527ea1cf","observation_id":"0c24c871-7424-4dbd-9ef7-7cfcd815f938","resolution":{"observed_at":"2026-08-07T14:58:42.689387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:42.831411Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.831411Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:81b6dcc0d791e7a6e264a6f4b5f3420f188308beffaf3d265e6557ee84e91d12","observation_id":"77cf92d9-e0bb-4fca-a558-d0a156acf04e","resolution":{"observed_at":"2026-08-07T14:58:42.831411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:45.518955Z","title":"Sylber: Syllabic Embedding Representation of Speech from Raw Audio,","venue":null,"work_id":"ad3a1ad9-3924-470f-9b43-841fdf327760","year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.931158Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:a3c66274835f2f67036a9c1e1dbb65e3716370f14b8326fec42e48bef551bed3","observation_id":"d2e6b46b-d719-43ed-8add-372332243e86","resolution":{"observed_at":"2026-08-07T14:58:45.683184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:43.078565Z","title":"SyllableLM: Learning Coarse Semantic Units for Speech Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.078565Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:a4db8f67461f890a75a5e59f0677085a8848bbf31c3ab5c382e884aafe8098be","observation_id":"3973831f-4011-4217-ab0f-2fb3457b03b6","resolution":{"observed_at":"2026-08-07T14:58:43.078565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:45.230551Z","title":"Towards accurate image coding: Improved autoregressive image generation with dynamic vector quantization,","venue":null,"work_id":"1f5c592c-982f-491f-9344-10cb3cda02aa","year":2023},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.210046Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:5af4fdcef76953071c40d19815d3b5e1542fdb4aeefb8795ed629293c33d9368","observation_id":"322c233e-f3c4-4cb2-bae5-5018b0dafcb0","resolution":{"observed_at":"2026-08-07T14:58:45.379220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:44.999206Z","title":"Spatial entropy-based global and local image contrast enhancement,","venue":null,"work_id":"4b0d9cfe-43b3-4c43-a605-3cb552ec9e4d","year":2014},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.331009Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:9af97ff8a0c33fedcb41d354eb7d9f9da40e2665348826f9064a7d4aca174bc3","observation_id":"9565f884-2306-4a8e-a513-d6ed129ccd5d","resolution":{"observed_at":"2026-08-07T14:58:45.106733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:44.794525Z","title":"Codec-SUPERB: An in-depth analysis of sound codec models,","venue":null,"work_id":"8fe9559a-39ec-4214-8477-9d67383d8004","year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.461673Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:c5cfe32f36da91549ac8fc2d38845d25fc33883ba0667564ba39dc36b26b6c46","observation_id":"5997a76e-646a-425e-b0bf-1b2cbbf298d2","resolution":{"observed_at":"2026-08-07T14:58:44.894167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:43.578963Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.578963Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:f6902b302171c22707ab045889f5fa2ee4ee213e8d1967b7af55ee463ae48acb","observation_id":"2123ebf6-f601-4efb-98c9-5ca46a493059","resolution":{"observed_at":"2026-08-07T14:58:43.578963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:44.515025Z","title":"UTMOS: UTokyo-SaruLab System for V oice- MOS Challenge 2022,","venue":null,"work_id":"64de5160-91d7-4650-85a7-6a3c656acbb5","year":2022},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.670350Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:f641eb1b804f0ce193e2a29446bbb060542eed85ad3fd6d84def1e7296e5de03","observation_id":"df5df50a-2b3f-4d2e-bc70-bb944c19c588","resolution":{"observed_at":"2026-08-07T14:58:44.642988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:44.245569Z","title":"V oiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"179cdb4b-e14c-4a9e-ac52-d9ec83fb5575","year":2024},"citing_paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:43.768535Z"},"links":{"citing_paper":"/paper/2505.16845"},"observation_digest":"sha256:c40f2b9ee0d8f2c60bfc2dc6758db3a1c98ad3b2c6c950d62b7cbd5a64ebbed5","observation_id":"d03f8d1e-05fd-4259-9ca6-d9dccc4d58d9","resolution":{"observed_at":"2026-08-07T14:58:44.376934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16845","last_updated":"2025-05-22T16:10:01Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T13:41:07.824764Z","submitted_at":"2025-05-22T16:10:01Z","title":"Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2505.16845."}