{"as_of":"2026-08-20T14:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0113b2d6936e72906a0f5323650cce11cab833eb98a3f39dac2b80c5611bbd1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:52:49.748472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:37:34.396958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-12T20:13:57.375568Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.375568Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:5805765e82a5ae70926e226079abdf29c15681d7e2a38e3e899649009118ee96","observation_id":"800bb696-9382-4988-94b7-9b2b9178d651","resolution":{"observed_at":"2026-08-12T20:13:57.375568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-12T15:37:59.256646Z","title":"and Wei, F., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14100","last_updated":"2024-12-21T19:15:27Z","snapshot_observed_at":"2026-08-18T17:09:06.182618Z","submitted_at":"2024-11-21T13:05:18Z","title":"BEST-STD: Bidirectional Mamba-Enhanced Speech Tokenization for Spoken Term Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:37:59.256646Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2411.14100"},"observation_digest":"sha256:ebd770f4d0d1ec4714aefed0fadec31f1c99e38ac62510c6a206f5c64c59058d","observation_id":"0111d5a5-52f0-4b14-b57a-99782459c5a0","resolution":{"observed_at":"2026-08-12T15:37:59.256646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-11T14:59:01.849435Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-19T22:19:56.931776Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.849435Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:a8926a0148adce35c6bce7ba5fbb51c03ab0c9ba4b165b1d3318a8486b0271d9","observation_id":"8a117a4c-2043-4e70-b042-265b3e9255b6","resolution":{"observed_at":"2026-08-11T14:59:01.849435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T22:40:25.437559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01034","last_updated":"2025-01-11T03:47:08Z","snapshot_observed_at":"2026-08-14T10:48:07.529275Z","submitted_at":"2025-01-02T03:28:52Z","title":"Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:25.437559Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.01034"},"observation_digest":"sha256:9349c02b2a15ef3b340f10f33cebf6cda63927a89e31585324633bbcfc44cb9a","observation_id":"d1ce8f71-f084-45bb-be76-1c4d9fe0a218","resolution":{"observed_at":"2026-08-10T22:40:25.437559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T22:18:01.599424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.599424Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9504df6af5af007ac9e2a5b8fb3797c056c86ccad15fc49a08f7eedf0a2c9cfc","observation_id":"df371e8f-507e-43ae-8b4e-3424983f3466","resolution":{"observed_at":"2026-08-10T22:18:01.599424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T18:17:35.497624Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-14T15:57:34.849066Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.497624Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:6ca6b87f3e920fdae15a12f3c944ec2c7939d07ae7200256d4141c98243cd09c","observation_id":"5bad9113-8d95-4f27-a1a3-14cd052698d5","resolution":{"observed_at":"2026-08-10T18:17:35.497624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T14:21:56.781684Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-19T01:21:28.929963Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.781684Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:1f757f72d4124cde46402fe350a8a4fc0f53979afe5abc8da24f673f210a8a25","observation_id":"46b82778-5d37-4368-9455-c69442a9b454","resolution":{"observed_at":"2026-08-10T14:21:56.781684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T12:30:52.072980Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-08-19T19:12:27.978893Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T12:30:52.072980Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.17202"},"observation_digest":"sha256:27d65b46f90df127d8dd67f87c100f9a837dcd8fcb1b1e944df835456d8d2410","observation_id":"1ec89678-f4b5-4d0e-a619-1e8f71e72fff","resolution":{"observed_at":"2026-08-10T12:30:52.072980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T20:02:51.327669Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-19T20:15:01.240634Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.327669Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:8b14465ef5c2fc68f0d5c1cb0a988c703add36e6dd100c717a379c11446ced91","observation_id":"b680d517-637c-45a4-abb2-09fcb9126e8c","resolution":{"observed_at":"2026-08-07T20:02:51.327669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:8781607e05539517aa2e3cc300321f0cd128d311df6e7fea3dfceaaff8d6d584","observation_id":"eb985253-43d0-4221-9e6f-15dd2dab079f","resolution":{"observed_at":"2026-05-18T13:39:48.359286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T15:33:49.525285Z","title":"Wavllm: Towards robust and adaptive speech large language model.arXiv preprint arXiv:2404.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-19T20:26:23.124920Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:49.525285Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.14648"},"observation_digest":"sha256:6c50c17af918cc74facad8de86c729c5e11085151a7b90bccd1af47739f23707","observation_id":"a302002f-5c66-46e8-87fa-14ce7f01c409","resolution":{"observed_at":"2026-08-07T15:33:49.525285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:33:47.276785Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-13T03:07:48.461288Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:47.276785Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.18517"},"observation_digest":"sha256:ddfac9f3e3dc7db49470eaf46b16a8334497d182d253c3528d2847ca279ef875","observation_id":"23f2d7f6-e5e9-40ff-8a66-6420ed41fd2b","resolution":{"observed_at":"2026-08-07T14:33:47.276785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:24:34.067293Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19037","last_updated":"2025-05-25T08:37:55Z","snapshot_observed_at":"2026-08-17T12:03:52.615757Z","submitted_at":"2025-05-25T08:37:55Z","title":"Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:34.067293Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19037"},"observation_digest":"sha256:8e14b08123636b247269870ef688d61ae8a3e864176b169606f7acdf0280ffb0","observation_id":"39dc1cdd-a81c-44c2-89b0-8999099d6d37","resolution":{"observed_at":"2026-08-07T14:24:34.067293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:23:33.844445Z","title":"WavLLM: Towards robust and adap- tive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19163","last_updated":"2025-05-25T14:22:18Z","snapshot_observed_at":"2026-08-18T01:53:39.592780Z","submitted_at":"2025-05-25T14:22:18Z","title":"SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:33.844445Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19163"},"observation_digest":"sha256:0da7e9036aeb496fc87fa600cc997e1df2be332fa3b446cea9473fd5d2ea46e9","observation_id":"9758e2b8-382e-4345-be9b-0970a5209c8d","resolution":{"observed_at":"2026-08-07T14:23:33.844445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:15:55.743399Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.743399Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:e34a2f9945b87069cef1e6ab14a8931a2b81adc60ba1407002decd340cf7cb0d","observation_id":"0f9d2bf0-68e8-41e4-8fa5-9059d48c1758","resolution":{"observed_at":"2026-08-07T14:15:55.743399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:07:22.593442Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-16T04:07:17.132430Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.593442Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:5c01d889d46122f472e7806b1cf66833574644b14557a5937416017ce5bfd01a","observation_id":"c481c263-ae91-4edd-b67e-aece03537254","resolution":{"observed_at":"2026-08-07T14:07:22.593442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:01:30.469502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-13T04:50:32.015134Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:30.469502Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.20277"},"observation_digest":"sha256:b108d8562bad22602b1800814ba61e93d1db8c4b3756ef97283359c66b7ff18f","observation_id":"2d50605a-97c0-47c4-8eaf-39bcf667dc6b","resolution":{"observed_at":"2026-08-07T14:01:30.469502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T13:17:59.761074Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-12T13:13:08.532263Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.761074Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:0a7ddf5a6d071ab4f2c38b04e7e52f2989cb0c6154ac772bb641541ae915abd3","observation_id":"0901f8d5-522a-4fc3-9a6d-41b30ebce6f4","resolution":{"observed_at":"2026-08-07T13:17:59.761074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T11:37:06.539254Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model.arXiv preprint arXiv:2404.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01808","last_updated":"2025-06-02T15:52:57Z","snapshot_observed_at":"2026-08-15T04:10:24.000816Z","submitted_at":"2025-06-02T15:52:57Z","title":"NAVER LABS Europe Submission to the Instruction-following Track","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:06.539254Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2506.01808"},"observation_digest":"sha256:aa779d7bbeedb1c11abe33094ed8f6202bcfd464ec1b535f697ecde1ed83bd88","observation_id":"e44347e4-7050-40ad-adc0-08546cffa511","resolution":{"observed_at":"2026-08-07T11:37:06.539254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-06T23:41:49.527166Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-14T02:58:18.356312Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.527166Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:6a23a135185de6d2a7eef71159decf33623cf1f034cc3e37bb9d8aeaf43158d5","observation_id":"30911dfa-cd1f-4296-b876-2eec645a6286","resolution":{"observed_at":"2026-08-06T23:41:49.527166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-06T19:46:11.712860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-17T23:10:05.395532Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.712860Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:f37b773fa55be03145a945d77e8a0c9c142603e519d152f5a94a28754474bca3","observation_id":"4fccb077-0b67-487e-996f-acac6bec9f86","resolution":{"observed_at":"2026-08-06T19:46:11.712860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-15T17:52:49.748472Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.748472Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:fff03399df59446c25da2b16299d2139c5b9a0cfb90a4574e0c41ba5456f5259","observation_id":"0fdf5d1f-b198-4d7e-9318-0b7fc8e144fa","resolution":{"observed_at":"2026-08-15T17:52:49.748472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-05T13:03:14.524557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00988","last_updated":"2025-08-31T20:51:59Z","snapshot_observed_at":"2026-08-14T22:06:30.672844Z","submitted_at":"2025-08-31T20:51:59Z","title":"A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:03:14.524557Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.00988"},"observation_digest":"sha256:51a6d6d3dfb860876f29f2932c9721e9f0fb3728ae741c176968f26b6201b5c5","observation_id":"eddac622-e3c2-4186-a8bb-b36bb8e41ac1","resolution":{"observed_at":"2026-08-05T13:03:14.524557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-15T03:55:37.990374Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:b9a7763947ac0ebde26cb7a57dab8adecd54740a9ac9b3d3ac4039b051811a07","observation_id":"3a65ff3c-010c-48c3-a432-af3a74704ccc","resolution":{"observed_at":"2026-05-21T22:24:23.512556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-05T13:53:24.835833Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-09T19:27:14.383248Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.835833Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:5725fa365ddc6bbcb9cd25081369b6cfb832de1dfe2fef38103e3a94e2c2abe4","observation_id":"9bf4cc41-8be5-499a-ab66-a0aa23b369a8","resolution":{"observed_at":"2026-08-05T13:53:24.835833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-08-14T07:37:13.185382Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:d6bd1940a2efa077e94226cc03048d8cda6cb347ab3dd33888772104a344e2b1","observation_id":"972007dd-402b-4d7e-aa27-778be2800211","resolution":{"observed_at":"2026-07-03T13:18:12.804002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2606.26824","last_updated":"2026-06-25T10:04:35Z","snapshot_observed_at":"2026-08-18T17:09:04.080689Z","submitted_at":"2026-06-25T10:04:35Z","title":"wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T02:49:35.819155Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2606.26824"},"observation_digest":"sha256:b20829f2a8978522c906acaf140bb0f4d4da120c947701a8e914550a46132bcf","observation_id":"2dab21e0-b00b-4940-96c8-083110bdb8a5","resolution":{"observed_at":"2026-07-04T14:39:58.380231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-16T16:14:29.920466Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:769476903e68dee19d868bfe7c3ae401a144f43444db1d2721b8b2dff583cae7","observation_id":"8e2f9176-2dbf-40c1-99b9-f4b58f4d0be4","resolution":{"observed_at":"2026-07-02T17:07:12.183604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-04T04:34:50.946446Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-16T16:14:29.920466Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:50.946446Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:5225d04a94415ceca9911ccb60c392cc05109e167996d147dad056777361d228","observation_id":"c774a0a5-b0d9-4324-803a-1a86053f725e","resolution":{"observed_at":"2026-08-04T04:34:50.946446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.01960","last_updated":"2026-07-02T09:52:08Z","snapshot_observed_at":"2026-08-18T17:09:38.135738Z","submitted_at":"2026-07-02T09:52:08Z","title":"NAVER LABS Europe Submission to the Instruction-following 2026 Short Track","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T15:04:02.640015Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.01960"},"observation_digest":"sha256:9e0f28219d3a9fe7a6538730ace07fc1d2f4cf3fc777a4a1757fd7c4589fb10f","observation_id":"63af21e0-5f45-421c-b25e-25dcd9573349","resolution":{"observed_at":"2026-07-03T15:08:32.423186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e8efdd1098e75e0e8baad2f1ee8b005922e3371a00ed338024ec16df0a98582f","observation_id":"6e4c7289-d80d-4a0b-906f-af201dded00d","resolution":{"observed_at":"2026-07-07T14:53:55.789976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-11T04:47:56.963554Z","title":"arXiv preprint arXiv:2404.00656","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05623","last_updated":"2026-07-15T07:17:15Z","snapshot_observed_at":"2026-08-18T17:09:03.652861Z","submitted_at":"2026-07-06T20:31:41Z","title":"NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T04:47:56.963554Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05623"},"observation_digest":"sha256:f7500d30dc6ec6f4660f959d8013957249206c28f9e75541d71fc5b8ae4d820d","observation_id":"f1d48f1e-066c-4610-8783-4b66cd7f5a09","resolution":{"observed_at":"2026-07-11T04:47:56.963554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-02T08:30:02.391299Z","title":"arXiv preprint arXiv:2404.00656","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05623","last_updated":"2026-07-15T07:17:15Z","snapshot_observed_at":"2026-08-18T17:09:03.652861Z","submitted_at":"2026-07-06T20:31:41Z","title":"NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:30:02.391299Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05623"},"observation_digest":"sha256:8149bfad2368ed5216915bd44acb3eee68fd0269dc6f9494bc1e1c3ca8c1b66c","observation_id":"afeac008-e22d-4945-a197-29c902ed6a3c","resolution":{"observed_at":"2026-08-02T08:30:02.391299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.06827","last_updated":"2026-07-07T21:45:04Z","snapshot_observed_at":"2026-08-16T02:43:35.821398Z","submitted_at":"2026-07-07T21:45:04Z","title":"Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T20:30:11.127007Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.06827"},"observation_digest":"sha256:66bff8e17550f896e3e713390a686a60122f2eb0ab7f172461d23de86c9a6916","observation_id":"3fe8e6f2-f109-49ef-bf16-6fcddfd29a9d","resolution":{"observed_at":"2026-07-10T20:37:34.398583Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-01T07:18:27.114855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21496","last_updated":"2026-07-23T16:43:12Z","snapshot_observed_at":"2026-08-06T07:15:08.007377Z","submitted_at":"2026-07-23T16:43:12Z","title":"Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:18:27.114855Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.21496"},"observation_digest":"sha256:8577b889f1475e0cda831ac6c6ec8133a34a5eef8b820d187cff5570eb07d04c","observation_id":"9d169afa-8bba-4e92-95e4-1b1b83d6a072","resolution":{"observed_at":"2026-08-01T07:18:27.114855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.00656/citation-record","integrity":"/paper/2404.00656/integrity","json":"/paper/2404.00656/citation-record.json","paper":"/paper/2404.00656"},"outbound":[],"paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2404.00656."}