{"as_of":"2026-08-15T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:777d5aff5dd7f03c9bdefcb9ede0d7b4347e5165bd8cfd1b8d15841e68dc31aa","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:00:14.179533Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20660/citation-record","integrity":"/paper/2508.20660/integrity","json":"/paper/2508.20660/citation-record.json","paper":"/paper/2508.20660"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.017016Z","title":"Sdr–half-baked or well done? In ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"acb14320-125d-4201-8be8-4b0b494694f9","year":2019},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.014177Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:4b7b4161085cbed267f303a1ff6c8a4ae4109243e341ec71299d6f6d9a78c641","observation_id":"e9045120-c6bd-4e02-a8ef-0072e4086007","resolution":{"observed_at":"2026-08-05T15:00:15.022586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.878159Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":"a66a6ccb-37dc-4463-9188-6a11c618fd5f","year":2015},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.032179Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:0d756de2a40b57aee9f7dbbadf0898cda418abd5f8bff40412999141ef7dd928","observation_id":"0c97b505-afe9-45f2-9ef1-596b508117c7","resolution":{"observed_at":"2026-08-05T15:00:14.924421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-14T18:19:10.821318Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-05T15:00:14.045603Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.045603Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:a27bacaacc405effc499dad514229586a90498aca82676568504b6b6cdb31e4e","observation_id":"8f3a2d7c-3c5c-4a82-ad09-b6f4e4ee3e4e","resolution":{"observed_at":"2026-08-05T15:00:14.045603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.761156Z","title":"A short-time objective intelligibility measure for time-frequency weighted noisy speech","venue":null,"work_id":"b1fd5509-2dff-44d9-b7e2-36eda9be88f1","year":2010},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.064215Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:fc79fc9e19045ca22de22ff2288605844a74a33b56f1e15a3d81881f32108d80","observation_id":"49e0a2e3-dd50-461a-a6b3-fc6499b242ff","resolution":{"observed_at":"2026-08-05T15:00:14.812907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T15:00:14.073906Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.073906Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:6a95a8ef99d1580ffe42dc57ff775426a65b42227f520fe0a385341f0e964ed6","observation_id":"92059eaf-e1d3-4fd6-a32d-58e5de8d0d8c","resolution":{"observed_at":"2026-08-05T15:00:14.073906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-12T22:53:35.238599Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T15:00:14.080956Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.080956Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:898aee6e1677a5c1e321d7ce8525292012dee7ced061270d96e37b94f1e3b9af","observation_id":"cd815554-0fb7-4877-a0b9-f2406c475e7b","resolution":{"observed_at":"2026-08-05T15:00:14.080956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01485","last_updated":"2025-03-03T12:49:09Z","snapshot_observed_at":"2026-08-11T18:08:30.113117Z","submitted_at":"2025-03-03T12:49:09Z","title":"FlowDec: A flow-based full-band general audio codec with high perceptual quality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01485","snapshot_observed_at":"2026-08-05T15:00:14.089389Z","title":"Flowdec: A flow-based full-band general audio codec with high perceptual quality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.089389Z"},"links":{"cited_paper":"/paper/2503.01485","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:16f35c99a77acb856616399275cff4677dae3b06d43f7e100f49cb3c68ece6a9","observation_id":"379d0d46-c6e6-48b0-b389-e657e0d22e09","resolution":{"observed_at":"2026-08-05T15:00:14.089389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13071","last_updated":"2024-09-18T12:02:47Z","snapshot_observed_at":"2026-08-13T04:14:27.294775Z","submitted_at":"2024-02-20T15:13:38Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13071","snapshot_observed_at":"2026-08-05T15:00:14.103442Z","title":"Codec-superb: An in-depth analysis of sound codec models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.103442Z"},"links":{"cited_paper":"/paper/2402.13071","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:d256ad8f761003a08ee6888eb59b4c042949291698c0b12b3f7282756c36b0aa","observation_id":"dd009f05-b7c0-49a8-bca3-cdaa2670d4a1","resolution":{"observed_at":"2026-08-05T15:00:14.103442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12442","last_updated":"2023-05-26T13:17:11Z","snapshot_observed_at":"2026-08-13T11:37:55.843056Z","submitted_at":"2023-05-21T12:25:25Z","title":"Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus","version":2},"cited_work":{"arxiv_id":"2305.12442","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12442","snapshot_observed_at":"2026-08-05T15:00:14.374742Z","title":"Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus","venue":"cs.SD","work_id":"58c82df7-700d-4575-88e4-54dc35b4d9e4","year":2023},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.116555Z"},"links":{"cited_paper":"/paper/2305.12442","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:48e89f193a9aae61fc92623a759c945860f51f62dfd29e3a9080caade1f3ef06","observation_id":"ef9e0fda-ef88-4633-b2cc-8b8da6e8ec72","resolution":{"observed_at":"2026-08-05T15:00:14.381991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-12T22:48:53.150999Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-05T15:00:14.133170Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.133170Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:6ed596f7960bee03a46c11a10a258a1ce14bb6a64b94f9d02ec8a126f6f8aacf","observation_id":"d06df0a6-9d79-4011-803e-22139be9f85e","resolution":{"observed_at":"2026-08-05T15:00:14.133170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T15:00:14.143419Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.143419Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:4a368cfe934051fb77766fba92a534b2e0ecd44950163172feec4148d10eb54e","observation_id":"ccf870b0-a18d-4c93-abe1-94eff0dcee0c","resolution":{"observed_at":"2026-08-05T15:00:14.143419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T15:00:14.150027Z","title":"Aohan Zeng, Zhengxiao Du, Mingdao Liu, Kedong Wang, Shengmin Jiang, Lei Zhao, Yuxiao Dong, and Jie Tang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.150027Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:49f67ebb7ac87f0aa0e36e9f1bbcb43d6812bec9fb4932fb002b34ebf926a19e","observation_id":"31ade6f1-8007-4a2f-84af-848fe68826cc","resolution":{"observed_at":"2026-08-05T15:00:14.150027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-13T11:39:26.737742Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T15:00:14.159489Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.159489Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:1b763d77918301a729ac0aaf8b0925af170c9914c38d0e2d385b1cfab20075d7","observation_id":"c53f719a-b5e5-4271-b8d6-e98932066d8e","resolution":{"observed_at":"2026-08-05T15:00:14.159489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-15T00:22:53.406062Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T15:00:14.164561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.164561Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:db5d362b0b338225f42499430917ce841cac30c6d8e4fa23524b71c9af28e502","observation_id":"93203482-b7d1-49f0-8ed7-7fd2812cbe20","resolution":{"observed_at":"2026-08-05T15:00:14.164561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.693389Z","title":"The clips within this dataset are manually selected from public field recordings compiled by the Freesound.org project","venue":null,"work_id":"0c4ecf33-4580-4a75-90dd-15aa00423040","year":2000},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.173358Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:222ada1e93e8f733ad398bb2c12ffd13688e08d1e467c239fc71d2deed117a58","observation_id":"5e2992c9-eb93-4c69-8f52-ea94bc1765ae","resolution":{"observed_at":"2026-08-05T15:00:14.706512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.662656Z","title":null,"venue":null,"work_id":"e4e7acfa-d8ac-4d19-be12-e549b37115c3","year":1991},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.179533Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:89a0af23c2dc55ab5a682c50599d6bb96f05e870996016ffd667fe060ef6c064","observation_id":"5445decb-3782-43f6-ab4d-934660afc49d","resolution":{"observed_at":"2026-08-05T15:00:14.675893Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-11T15:07:28.270038Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-05T15:00:14.058277Z","title":"Versa: A versatile evaluation toolkit for speech, audio, and music","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.058277Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:6937d6591b1b56041c0e64b6666286db9cd729c809b6a9f057916cfbaea3f8c2","observation_id":"2fb3cf35-e48e-468f-83b3-8bc50d89a366","resolution":{"observed_at":"2026-08-05T15:00:14.058277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.071512Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"5533f681-0796-40cc-8138-3166df8b24be","year":2017},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.991843Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:703379057234ebf9f2026cf8cb63e230ca80ec432f2c55a6d390235c0c4004f4","observation_id":"71afe80c-116d-42cc-b965-6cffa81d88dc","resolution":{"observed_at":"2026-08-05T15:00:15.077517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.092989Z","title":"Visqol v3: An open source production ready objective speech and audio metric","venue":null,"work_id":"6de8c2e8-8745-40c8-be53-d7e9ab86af09","year":2020},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.973695Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:9dd35404a9b258485b0383acabce8ad0136ecdcbefe4499fab3371e98e09ef80","observation_id":"e4178831-f504-4363-8fbf-12f1d8439c64","resolution":{"observed_at":"2026-08-05T15:00:15.100047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-08-13T15:53:14.922964Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-05T15:00:14.039324Z","title":"Scaling transformers for low-bitrate high-quality speech coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.039324Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:b4ff4724719e5ddd1a48761a0bc34cfed9c9fe396777347f26d57ad9f95037b5","observation_id":"a1fb8b1a-4fd4-46d0-a271-3b7e7aeec344","resolution":{"observed_at":"2026-08-05T15:00:14.039324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.727793Z","title":"1632–1636,","venue":null,"work_id":"a88ff572-2205-4674-9d74-61ca44bdb383","year":2016},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.069461Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:cbfbe6251eb08ac535467ba53331aa4d381e7703f3df3ee4166ab80de4d9c206","observation_id":"3190eddb-5666-4dde-8754-2cc8bf56d42b","resolution":{"observed_at":"2026-08-05T15:00:14.741535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.053966Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition","venue":null,"work_id":"e71bdf6c-b1fb-440c-be94-5212e9db19cd","year":2022},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.999297Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:598da407a5e5c9be4abacc09134669f2c845df815770d7e9b659d3fd54b6f0bf","observation_id":"ef66f28f-a91b-48ba-9091-de9ec5c49eb6","resolution":{"observed_at":"2026-08-05T15:00:15.059689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-10T12:13:34.640551Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-05T15:00:14.020393Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.020393Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:f78c10590526b47a3dccf30c325de085d52ab8107795154cba87fcd9d7162d05","observation_id":"40b1610e-2ed8-40ec-b53c-be989790466a","resolution":{"observed_at":"2026-08-05T15:00:14.020393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-10T10:54:26.224254Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-05T15:00:13.980353Z","title":"Librimix: An open-source dataset for generalizable speech separation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.980353Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:f9f38f9ccd2aa7d3377eca378c892382539e03235c75ab091e2ed0cb191c3504","observation_id":"9db2a1b1-70dc-40ce-a056-72781458b97b","resolution":{"observed_at":"2026-08-05T15:00:13.980353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T15:00:14.052024Z","title":"Antony W Rix, John G Beerends, Michael P Hollier, and Andries P Hekstra","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.052024Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:3ab51900ef8126536dd711c4b4a9621d343cdcceae17aa38e5228ad6fe10a44c","observation_id":"69c6417a-e655-405f-ad0b-77ab70ec46da","resolution":{"observed_at":"2026-08-05T15:00:14.052024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:15.035422Z","title":"Benchmarking representations for speech, music, and acoustic events","venue":null,"work_id":"f47f4deb-6723-41e5-b675-e50d9f3c11c4","year":2024},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.008369Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:0d129579fbea47564865c0443b6b76758fcb41d9bbef3ca4fcc21bbf3274aa6a","observation_id":"05f7c0ff-f8eb-47aa-8c09-462361b66ef4","resolution":{"observed_at":"2026-08-05T15:00:15.040602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T15:00:13.986387Z","title":"Accessed: 2024- 10-01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:13.986387Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:2513d33a0e8ea322c3231ac7a8d7199b3ce5116175fe47894b2aedcd5c67e966","observation_id":"d8fd45dc-73ae-4d33-b7fc-36a93b950a4c","resolution":{"observed_at":"2026-08-05T15:00:13.986387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:00:14.993370Z","title":"Clotho- aqa: A crowdsourced dataset for audio question answering","venue":null,"work_id":"ed9f9594-82ca-47c0-b17a-12ca83c433db","year":2022},"citing_paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:14.026878Z"},"links":{"citing_paper":"/paper/2508.20660"},"observation_digest":"sha256:2c0ff7f708b1fc91504e89083f6a3c1c8b70691b3eba57de2bb4392a504bac62","observation_id":"c2a2d476-99a5-47f2-b5ce-84675ebd4f29","resolution":{"observed_at":"2026-08-05T15:00:15.001969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20660","last_updated":"2025-08-28T11:07:36Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T21:36:45.183330Z","submitted_at":"2025-08-28T11:07:36Z","title":"CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2508.20660."}