{"as_of":"2026-08-24T02:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63f28bd2a1fc9b92613db21e9a7d7090ab60a4fcac1f8cced3dacceb05c7550a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:52:49.813356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:a093701fc91caa6669ff4c282360b4d79f1a4792687ea53587c6e9daf9d74cd9","observation_id":"474d7e28-d8cc-4621-ae66-e608e21415dd","resolution":{"observed_at":"2026-05-11T02:14:45.462747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-12T20:13:57.160614Z","title":"Speechverse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.160614Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:6fae6aad285de294bb6564b561b8ef8e335e49e62daa086ad08b0907cb07a110","observation_id":"4d1dd1b5-327b-4a08-8f2b-1ff04dd74303","resolution":{"observed_at":"2026-08-12T20:13:57.160614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-12T04:44:25.866877Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01145","last_updated":"2025-07-03T22:18:03Z","snapshot_observed_at":"2026-08-18T05:22:14.276691Z","submitted_at":"2024-12-02T05:42:33Z","title":"AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:44:25.866877Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.01145"},"observation_digest":"sha256:71a96a9cfa6794a0fb9fe2f0501ce5269606a5a161aa2757320b619cd8139fc6","observation_id":"7df69f19-523c-44be-8936-bd2a9a07ecf9","resolution":{"observed_at":"2026-08-12T04:44:25.866877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T14:27:27.306355Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.306355Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:78df83f3f0bdc1d62de7bb0b343b6944ef8f1a9edfe776ec153b4d3c654714b7","observation_id":"07045fb6-57ee-4793-9e2e-aee6c25e3365","resolution":{"observed_at":"2026-08-11T14:27:27.306355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T05:08:17.616757Z","title":"Speech- verse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.616757Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:3df1845b9f9890fbefd6f5e417872f14d144f7fa86c7d4663063b8f0a7ad0235","observation_id":"4354f0ba-dcae-4d10-b5ba-6989fe90e10c","resolution":{"observed_at":"2026-08-11T05:08:17.616757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T14:59:01.455567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-21T08:28:48.041857Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.455567Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:bdec8a99ec5c81b67a639b52792310a4b01841fababd1ce07e7ea0137e278284","observation_id":"0137b1e5-542f-4dbf-a1c7-5b910742c6b6","resolution":{"observed_at":"2026-08-11T14:59:01.455567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T20:15:28.366374Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-18T01:52:36.466119Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.366374Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:9fadcc29f8ce683581974297fa71079f0602c9c04c4f73e9c7dec9668a2ee6dd","observation_id":"986c61e3-f5ce-4887-9e99-81673de043b5","resolution":{"observed_at":"2026-08-10T20:15:28.366374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T14:36:19.683344Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-24T01:32:26.564291Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.683344Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:bcf7eae4c018ed6c4c759c4f32a2f3eda318a70baa269d46bbffc01f7a499735","observation_id":"03848df2-7aae-4738-9530-917405104a4c","resolution":{"observed_at":"2026-08-10T14:36:19.683344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T13:34:25.652272Z","title":"M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16327","last_updated":"2025-01-27T18:59:51Z","snapshot_observed_at":"2026-08-21T00:28:41.603095Z","submitted_at":"2025-01-27T18:59:51Z","title":"LUCY: Linguistic Understanding and Control Yielding Early Stage of Her","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:34:25.652272Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.16327"},"observation_digest":"sha256:02ccca03769d51cbfcb9dea6c5dd2f5faf77e80209f41c5792d9f95adf514ec0","observation_id":"698c57b9-b00b-4d48-bd6b-cfd0734fdf31","resolution":{"observed_at":"2026-08-10T13:34:25.652272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T12:30:52.057019Z","title":"Speechverse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-08-19T19:12:27.978893Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-10T12:30:52.057019Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.17202"},"observation_digest":"sha256:839cd47b86add1e0b83fe4edfb4605b37d4f4508099d202136de4fa6b218ae2a","observation_id":"906cd69b-d30e-43f9-9143-7bb3626278ef","resolution":{"observed_at":"2026-08-10T12:30:52.057019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T04:36:38.420849Z","title":"Speechverse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18648","last_updated":"2025-03-21T18:17:47Z","snapshot_observed_at":"2026-08-17T01:09:48.354777Z","submitted_at":"2025-01-29T16:38:57Z","title":"Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey","version":2},"reference_index":292,"source":"pdf_text","source_observed_at":"2026-08-10T04:36:38.420849Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.18648"},"observation_digest":"sha256:232073a29ec07d03cb6f4750b7fd62f42c470119c419e4026a33280dc17334e7","observation_id":"36dc9981-931a-4677-b49c-686fae2f3684","resolution":{"observed_at":"2026-08-10T04:36:38.420849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-07T22:05:23.794304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09284","last_updated":"2025-05-30T17:30:40Z","snapshot_observed_at":"2026-08-17T21:44:55.762301Z","submitted_at":"2025-02-13T12:57:15Z","title":"SparQLe: Speech Queries to Text Translation Through LLMs","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T22:05:23.794304Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2502.09284"},"observation_digest":"sha256:71087a7376190b454eaf5ca3e381df992431ae7a89d291ae3604935e88e8d0b4","observation_id":"68bbb0fc-c561-44ac-a269-d8ae6f1a0680","resolution":{"observed_at":"2026-08-07T22:05:23.794304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:65d059ed86dfaf6718b49f7fac7e26bfbfd5f97d281225a1fcec51aa04970127","observation_id":"62792d3a-d3f9-48b5-badd-2459f82d3802","resolution":{"observed_at":"2026-05-18T13:39:48.291681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:90ff9d438929bf6c8a6f657e378a0d6a7dea39669b14dc8324e9d0e0549d3f80","observation_id":"6f095213-9732-49f6-9f03-231262498176","resolution":{"observed_at":"2026-05-10T17:54:03.293192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-08-14T11:32:49.145887Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:22457a56ebf169d64e1489af8171db910b5174dabd7b1e96485969ce4b0b7740","observation_id":"c9bfbf4a-251a-4423-a3d4-c7be0a6c46ad","resolution":{"observed_at":"2026-05-22T20:45:07.987371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-07T14:30:32.222856Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-15T11:50:55.837908Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.222856Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:0f2711622a079c7f46ff4139be234eef03a24d63f7c9a8f7851b1d614caa7515","observation_id":"1e9316b4-b1fd-426f-8937-3caf555a31f6","resolution":{"observed_at":"2026-08-07T14:30:32.222856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-18T04:25:30.115862Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:8eddf59d56b665bc1c341ec51c776f0b0bf6bc901525cc1278feeadacc5d0cb1","observation_id":"443ccc8e-7d58-43a8-ba77-17d99a880be4","resolution":{"observed_at":"2026-05-11T21:22:37.293820Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-06T19:46:11.082340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-17T23:10:05.395532Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.082340Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:83c87fa2ba6f0c8657c89740474eed4aeed62a99f0c07c7703debd469e456421","observation_id":"0a06db11-99ae-49f8-8285-e4a32689457d","resolution":{"observed_at":"2026-08-06T19:46:11.082340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-06T18:21:31.841304Z","title":"Speechverse: A large-scale generalizable audio language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-23T04:00:41.383736Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:31.841304Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:aebe0d17184765ce2427ae8be6588777bb816a104121e8a2d9918823528f6d2d","observation_id":"fdb3b362-ebbd-455e-8dd6-55c2a7f4ad4f","resolution":{"observed_at":"2026-08-06T18:21:31.841304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-15T17:52:49.813356Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.813356Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:4c45e1dd108a4f6acadc212b75ead66d09098dd75a356a1d2743c73d46fc498c","observation_id":"8c41e6ba-b84d-4f4b-93a4-d03b4893ffbb","resolution":{"observed_at":"2026-08-15T17:52:49.813356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-06T10:59:03.105773Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23267","last_updated":"2026-08-10T08:33:06Z","snapshot_observed_at":"2026-08-15T17:03:03.477293Z","submitted_at":"2025-07-31T05:56:21Z","title":"Your Spending Needs Attention: Modeling Financial Habits with Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:03.105773Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.23267"},"observation_digest":"sha256:be665680f667027e17cba7ee271752f68b84004c7e16156b07526d3dcca029be","observation_id":"b91d2310-470c-4a35-a5e0-5ddf7a956343","resolution":{"observed_at":"2026-08-06T10:59:03.105773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T19:01:21.059534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14130","last_updated":"2025-08-19T06:58:16Z","snapshot_observed_at":"2026-08-20T15:11:20.438349Z","submitted_at":"2025-08-19T06:58:16Z","title":"EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:01:21.059534Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2508.14130"},"observation_digest":"sha256:9259b3e2c2275575b55646d48cb9c13246fd9583e691273c2be76e55a4514c8d","observation_id":"89172613-8aed-4848-822a-cc168751ec30","resolution":{"observed_at":"2026-08-05T19:01:21.059534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T15:27:29.283691Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19856","last_updated":"2025-08-27T13:16:31Z","snapshot_observed_at":"2026-08-14T10:06:51.848142Z","submitted_at":"2025-08-27T13:16:31Z","title":"TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:27:29.283691Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2508.19856"},"observation_digest":"sha256:2a127be289d9a814f643f7edec7292fa52d94ed05784dffd79da8319aeffb7ca","observation_id":"f54078c4-3e0f-4f78-99d6-2b2fa9376b3c","resolution":{"observed_at":"2026-08-05T15:27:29.283691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-15T03:55:37.990374Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:a0d30642ea0d17ed9258a48abd54bef102c45207b82823f26d71bc99ac7b44f6","observation_id":"44ed0d62-41c9-427e-9093-19ea7800fef0","resolution":{"observed_at":"2026-05-21T22:24:23.516544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-08-08T14:05:02.026578Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:754bb16248c99a7c200adec1f69569e11de3e47660be0349eebb8cdd511aeb03","observation_id":"24cce4b3-79af-445d-9dcd-fb45577f3dec","resolution":{"observed_at":"2026-05-18T16:31:36.857609Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2512.07571","last_updated":"2026-04-06T08:39:08Z","snapshot_observed_at":"2026-08-16T20:35:47.457728Z","submitted_at":"2025-12-08T14:05:40Z","title":"A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T00:46:08.921194Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2512.07571"},"observation_digest":"sha256:b4693d0779d93dfd24e4e92d1b533eba3eea11696ad15836f70d9b2b4ff15ad4","observation_id":"9a25b118-325e-4ad3-a8db-c625e6a19e72","resolution":{"observed_at":"2026-05-17T00:48:45.994945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-03T17:16:37.503517Z","title":"Speech- verse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-17T16:07:27.921903Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:37.503517Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:2539618f1333910aa897e82464ac796139eb08237f245a59d79c14e3571ce974","observation_id":"7950c080-4db3-4b22-9a33-64b1ead58181","resolution":{"observed_at":"2026-08-03T17:16:37.503517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2601.20898","last_updated":"2026-01-28T09:50:34Z","snapshot_observed_at":"2026-08-17T15:46:56.452017Z","submitted_at":"2026-01-28T09:50:34Z","title":"Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T10:37:56.416600Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2601.20898"},"observation_digest":"sha256:2ed3873953d1cfc5e9620b0460ba54686dded4a5a436bd972b9e28da9c50aabd","observation_id":"f701f70d-084b-4191-93fb-9320c4c6b1fa","resolution":{"observed_at":"2026-05-16T10:40:51.416440Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-08-09T23:39:03.326127Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:29c759f35c9c0bcb82ebd1bb2380a082e51a1f263fab12ceb094638cb6f6a80b","observation_id":"9e4419e8-9bf8-4396-862e-f2a4021a6b9c","resolution":{"observed_at":"2026-05-16T05:50:40.260650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-03T04:37:50.813861Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18452","last_updated":"2026-06-29T11:58:47Z","snapshot_observed_at":"2026-08-13T00:37:37.784307Z","submitted_at":"2026-02-04T13:25:47Z","title":"RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:50.813861Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2602.18452"},"observation_digest":"sha256:e8a833758ac755a403da0e0f1bcd99dcae5e94c8b519ef3dad0644a2e17849f5","observation_id":"bb44bd26-3154-4e60-aea1-c6402245406d","resolution":{"observed_at":"2026-08-03T04:37:50.813861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:b7f74ac6b4cfc037ed5dae6ade5d439fa1b4c1e0395c5ab664123ca420ad967a","observation_id":"8875ffd5-8b02-434c-9207-648105f67899","resolution":{"observed_at":"2026-05-11T04:50:56.282925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-16T00:00:14.809961Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:78d39a292ccb2bf51cdc92a83ba7cbe00151e7d6ce55b3f1cbf18bdc15f584b3","observation_id":"bcc2be79-4c71-42fa-8a17-0086fe8db9dc","resolution":{"observed_at":"2026-05-21T07:39:48.981456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2605.20414","last_updated":"2026-05-25T03:05:12Z","snapshot_observed_at":"2026-08-17T01:47:26.106095Z","submitted_at":"2026-05-19T19:10:30Z","title":"PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T06:54:41.345212Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2605.20414"},"observation_digest":"sha256:e73926639e7651f0503887b4ecd8fea18ca7bed8e908e925471b430a867629c3","observation_id":"60960240-19b8-47ba-b252-6a48a7d72167","resolution":{"observed_at":"2026-05-21T06:54:45.172403Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:4da009109b2adc8250fb8a6ad32cfe4005c9dad13ad62d68be5241e285e9e035","observation_id":"ed66c343-5d3e-4173-8a20-25e1c6f7bd57","resolution":{"observed_at":"2026-06-30T22:15:05.347302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Han, and Katrin Kirchhoff","venue":"arXiv (Cornell University)","work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2606.30671","last_updated":"2026-06-24T15:32:47Z","snapshot_observed_at":"2026-08-14T07:25:33.277604Z","submitted_at":"2026-06-24T15:32:47Z","title":"Enhancing BEST-RQ Pseudo-Label Quality through Online Refinement for Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T06:51:41.995108Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2606.30671"},"observation_digest":"sha256:c2e28ebfd7aec00c7411b5d6238bcb11456a84cf9e0dd133eff4dbf938b782fa","observation_id":"6754d537-dcf4-4b2d-b544-b7a8c614195d","resolution":{"observed_at":"2026-07-01T06:55:29.122979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.08295/citation-record","integrity":"/paper/2405.08295/integrity","json":"/paper/2405.08295/citation-record.json","paper":"/paper/2405.08295"},"outbound":[],"paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2405.08295."}