{"as_of":"2026-08-09T04:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29c33aee5926a4dfd0d9ff577595bc5973ee3754a3b7373d3cbc30b2e3202929","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:30:27.004124Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-08T22:30:27.004124Z","title":"Towards Audio Language Modeling-An Overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.004124Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:b04efb9801f3481f409bdd0619772d46caaf479d2aa3570efa362aa18620b3be","observation_id":"a7b5bfff-4835-4fca-9494-232bfbd952d1","resolution":{"observed_at":"2026-08-08T22:30:27.004124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:f96df91dfd7b742e693bbb048728cb862b7d808f43be165dd2561c8ffbdab6fd","observation_id":"152e2037-dd50-4766-900f-e45f6ed9c7d5","resolution":{"observed_at":"2026-05-22T20:45:08.204219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-07T11:50:45.820916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01319","last_updated":"2025-06-02T05:02:03Z","snapshot_observed_at":"2026-08-08T07:02:18.787880Z","submitted_at":"2025-06-02T05:02:03Z","title":"Learning Sparsity for Effective and Efficient Music Performance Question Answering","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:50:45.820916Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2506.01319"},"observation_digest":"sha256:465c234262ef000d7730c4617867e59241fe2c7eed637fabdcf1c3ba68093497","observation_id":"fb99c11b-297a-4068-8a44-b34c2e4f1c89","resolution":{"observed_at":"2026-08-07T11:50:45.820916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-07T05:43:08.337092Z","title":"Towards au- dio language modeling-an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-09T01:52:11.151345Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.337092Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:3b50c8544056c24682bfbc643b269aa311eebee31c9191e97591eb3494d689c9","observation_id":"ec034de6-3d8c-4ca7-9e9f-86ae48eb45fe","resolution":{"observed_at":"2026-08-07T05:43:08.337092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-06T21:51:36.281078Z","title":"Towards audio language modeling–an overview","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-07T07:10:18.010065Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:36.281078Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2506.23325"},"observation_digest":"sha256:5ef4ff5f7186588dbbd90fe46b75f35a0b4953766c59311d319c0a4815f77214","observation_id":"429258a5-fdab-4c66-94c3-0078deb08521","resolution":{"observed_at":"2026-08-06T21:51:36.281078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-06T17:43:53.301818Z","title":"Towards audio language modeling–an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-07T22:45:28.938815Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.301818Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:e7046258dec704124732196e5107069e3c2904ce256e379d79bfbb0d0565edd8","observation_id":"9d967d19-e2ff-4963-b199-fdb9b9f2e686","resolution":{"observed_at":"2026-08-06T17:43:53.301818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-06T16:47:34.416786Z","title":"Towards audio language modeling–an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-08T13:02:50.918593Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.416786Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:7186365f1f99f33d69f48f77d29e02288feab26f9e7e7e25d9298c968c0a6b16","observation_id":"cd07aad6-6f2d-4474-86e0-6e737ebc5f75","resolution":{"observed_at":"2026-08-06T16:47:34.416786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T16:01:52.834220Z","title":"Towards audio language modeling–an overview","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.834220Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:cfa497ef0ea74ad5ce306ac0ce3a04f2d760a198df0f6e489e338adc6429300d","observation_id":"536b2ec0-62b9-481b-b8ee-ab4ccc1042b9","resolution":{"observed_at":"2026-08-05T16:01:52.834220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T12:38:50.683004Z","title":"Towards audio language modeling – an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-08T08:22:52.330749Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.683004Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:4574bec1105c17274cc346d44ddb508546a9481570c4c83d602a49537175099d","observation_id":"b5f5294e-c570-4d40-a952-cbe42cef73c7","resolution":{"observed_at":"2026-08-05T12:38:50.683004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T05:01:37.073486Z","title":"Liu, and Hung yi Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:37.073486Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:d7736df5cbb37b48632330b0aa9b444ea0138ce203e8bd707156cc0b0479c861","observation_id":"c061f0f4-697c-43f6-b711-8f732d38abb6","resolution":{"observed_at":"2026-08-05T05:01:37.073486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-04T21:25:27.326589Z","title":"Liu, and Hung yi Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.326589Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:a01e6445acc76ce4415bffcb3917e569ed4456746203356866a4980ea6017cd6","observation_id":"341cae12-85cc-494f-8067-3c19f14c93e3","resolution":{"observed_at":"2026-08-04T21:25:27.326589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:846e0a82563541a24300d7a758e3f8634f8157dd974d3b9c0eaf878c0334b598","observation_id":"b7adefb2-5874-4e8b-8a3e-d4487ece71a4","resolution":{"observed_at":"2026-05-18T11:52:35.713570Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2604.17435","last_updated":"2026-04-19T13:34:52Z","snapshot_observed_at":"2026-08-03T18:14:19.780984Z","submitted_at":"2026-04-19T13:34:52Z","title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T05:36:07.090627Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2604.17435"},"observation_digest":"sha256:23d122186204c80ea3b1bd3eda7a9c83515a50c21250d977a154cbe13dc2fab9","observation_id":"f348969f-392c-4c6a-b56a-49936e6b55ae","resolution":{"observed_at":"2026-05-10T05:41:02.483589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-05T12:06:36.882921Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:3ef5cf6a7bc823dd61ec14b36536d05be3103e6525caad927b13f1c16ea0ab51","observation_id":"2d628b51-8860-41ea-8eb3-39352ed9185c","resolution":{"observed_at":"2026-05-12T00:41:26.269011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:6f723ef48557c0fc552e1dcf8809fcd1ea64c6280c924afd8310e40c9a6a9283","observation_id":"1411c4a8-c068-4e55-89ae-5d38c5aeae59","resolution":{"observed_at":"2026-05-11T19:16:08.854881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:80c4ca1bbfd362e4692ac4bc681d4382901f6e05fd9a54dc3f99131b5c11c2cb","observation_id":"149ddc70-4168-4d74-8ef2-2fb779029eb3","resolution":{"observed_at":"2026-06-30T23:15:07.870811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:215a17dfa18d2a5f6314b936c29b71b1e71b74cc4a0b15199df4df8f44383f7b","observation_id":"aa31f89c-0fb2-4faa-9a36-5c53ade57752","resolution":{"observed_at":"2026-07-01T20:46:13.825005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2606.07494","last_updated":"2026-06-05T17:48:46Z","snapshot_observed_at":"2026-08-03T05:11:42.143646Z","submitted_at":"2026-06-05T17:48:46Z","title":"Mitigating Proxy-to-Wild Domain Gap in Deepfake Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T20:43:29.213147Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2606.07494"},"observation_digest":"sha256:bc65ed62760b84f43acae56444816532ce50bc94a0ce44dc724129a0902f9837","observation_id":"31861423-8f53-4dba-9350-f132a457214d","resolution":{"observed_at":"2026-07-02T20:17:21.989251Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":"2402.13236","doi":"10.48550/arxiv.2402.13236","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Felix Wu, Kwangyoun Kim, Shinji Watanabe, Kyu J","venue":"arXiv (Cornell University)","work_id":"ec26714a-6e17-47fa-82e4-b956fcd16591","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:15d223dfe2328080408d2bec608a8c923857ab11d30086af06f1b7e726aed688","observation_id":"922edaf7-1f02-4279-acfe-b2a0d97960cf","resolution":{"observed_at":"2026-06-30T22:15:05.306809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.13236/citation-record","integrity":"/paper/2402.13236/integrity","json":"/paper/2402.13236/citation-record.json","paper":"/paper/2402.13236"},"outbound":[],"paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2402.13236."}