{"as_of":"2026-08-23T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b384a4bd5d67a50cb8aed2ebd2f9c543009fc00814ab4d76fd6207b402cc362f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:19:59.146352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:e9c6e8895c311e4ab8fd23243fb1766a502338c9e0c24180a220967b4f04c13d","observation_id":"b1a9b804-2953-4666-8849-742c3f602ebf","resolution":{"observed_at":"2026-05-17T00:50:14.018476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-12T20:13:58.086886Z","title":"Audiobench: A universal benchmark for audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:58.086886Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:5b5be982c313d207f618edfba9cc08e8a7b2baae3baa7a3c3ebcb23139d58dd5","observation_id":"b6f8fe61-ed50-4ee8-a7db-66ffc4118949","resolution":{"observed_at":"2026-08-12T20:13:58.086886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-11T16:46:13.336533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09818","last_updated":"2025-01-16T03:29:23Z","snapshot_observed_at":"2026-08-15T13:23:21.388081Z","submitted_at":"2024-12-13T03:15:05Z","title":"MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T16:46:13.336533Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2412.09818"},"observation_digest":"sha256:d7bb099604079ec837dcee01e3c09eaff5a32263ed76d9c1ec45f03766f0992b","observation_id":"4d9f8987-783e-46ff-897a-f2515da84d84","resolution":{"observed_at":"2026-08-11T16:46:13.336533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-11T14:27:27.254326Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12009","last_updated":"2025-03-30T02:39:14Z","snapshot_observed_at":"2026-08-17T13:24:14.277154Z","submitted_at":"2024-12-16T17:36:02Z","title":"SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:27:27.254326Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2412.12009"},"observation_digest":"sha256:226fc9bbd3d9401554ec5dd2bd848026f8c7af4aa6dbdb1e83f0353287746850","observation_id":"6b5f935f-5e54-4c99-b575-ea8ef3f15a60","resolution":{"observed_at":"2026-08-11T14:27:27.254326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T22:40:25.563518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01034","last_updated":"2025-01-11T03:47:08Z","snapshot_observed_at":"2026-08-14T10:48:07.529275Z","submitted_at":"2025-01-02T03:28:52Z","title":"Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:25.563518Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.01034"},"observation_digest":"sha256:95bd2afcf3575403476c226364f4bd00e88ea8aebf1f172bc70dd9489a08af54","observation_id":"b22e8a33-f036-4fe4-bb3f-4b9bd2faa5a3","resolution":{"observed_at":"2026-08-10T22:40:25.563518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T21:24:18.256256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04962","last_updated":"2025-05-27T16:14:30Z","snapshot_observed_at":"2026-08-17T03:02:03.416801Z","submitted_at":"2025-01-09T04:30:12Z","title":"VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:24:18.256256Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.04962"},"observation_digest":"sha256:5f2defd48c57f007064962d8828bd169f8385e8faaf59750e5fa928036455118","observation_id":"e87f1a87-d1f4-4327-82aa-c7ad876f3b05","resolution":{"observed_at":"2026-08-10T21:24:18.256256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T14:36:19.925145Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-19T23:01:24.892193Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.925145Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:4859871bf03a9ffedb591120e88d7eaedfe2c3ab651c6ea5b713ed0989e1f2ce","observation_id":"ac52300f-da3f-4ae7-a13e-246550a4259a","resolution":{"observed_at":"2026-08-10T14:36:19.925145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-10T12:30:52.122984Z","title":"Dimension-based quality modeling of transmitted speech","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-08-19T19:12:27.978893Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-10T12:30:52.122984Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2501.17202"},"observation_digest":"sha256:62a8d196a79cc0e0dbe0b4eb8627372048dfcbc4801542bf9c4ad117099f3a8c","observation_id":"cbe61ebe-1ea8-4841-a900-d20a5fa16e6f","resolution":{"observed_at":"2026-08-10T12:30:52.122984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-09T19:24:20.433964Z","title":"Audiobench: A universal benchmark for audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00358","last_updated":"2025-02-20T22:37:12Z","snapshot_observed_at":"2026-08-15T17:16:56.962762Z","submitted_at":"2025-02-01T07:40:29Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:20.433964Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2502.00358"},"observation_digest":"sha256:1a420ee1ed81100bd29a39b9a4b7069954f2313f1bb63343b4da0f646b92bf8a","observation_id":"6d0e6881-6005-4f12-aecb-dac4844dd551","resolution":{"observed_at":"2026-08-09T19:24:20.433964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-08-14T11:32:49.145887Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:69d75c7191bb57c6e342e90ecc3ff17bf2c6bb9c96f147f20534329bf53ff309","observation_id":"2d19c0f1-da05-420b-90a0-6e611388aff7","resolution":{"observed_at":"2026-05-22T20:45:08.211361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-15T20:23:49.288989Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13115","last_updated":"2025-05-19T13:46:35Z","snapshot_observed_at":"2026-08-18T09:45:48.135690Z","submitted_at":"2025-05-19T13:46:35Z","title":"Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:49.288989Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2505.13115"},"observation_digest":"sha256:835f69adeae4611eb1265c23b2a5b84070f16c077d82c40e4011789a4787e8a1","observation_id":"efca0a97-0f39-4ac6-ad02-50bf9acf02c3","resolution":{"observed_at":"2026-08-15T20:23:49.288989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T14:07:23.503947Z","title":"Wu, J., Gaur, Y ., Chen, Z., Zhou, L., Zhu, Y ., Wang, T., Li, J., Liu, S., Ren, B., Liu, L., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-16T04:07:17.132430Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:23.503947Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:a5db99e7d958c356ff2f2304c9094e32550398869a6cf90ae53b723cb6db0fa9","observation_id":"20831a34-18e7-4c68-9a0e-3efe59b7320f","resolution":{"observed_at":"2026-08-07T14:07:23.503947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-15T21:19:59.146352Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01973","last_updated":"2025-07-12T08:52:48Z","snapshot_observed_at":"2026-08-19T11:28:04.593796Z","submitted_at":"2025-05-15T10:08:34Z","title":"Multimodal Financial Foundation Models (MFFMs): Progress, Prospects, and Challenges","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:19:59.146352Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.01973"},"observation_digest":"sha256:4aa6040293e0abd7a65fb034a6f22e65419f857a2ab73d4f9def9d9e98d148a2","observation_id":"81f2ac99-dae6-4374-ac32-28a3bdc6c38e","resolution":{"observed_at":"2026-08-15T21:19:59.146352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T11:28:59.437281Z","title":"Audiobench: A universal benchmark for audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-13T12:54:08.987275Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.437281Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4d75dc21445b766da542c1d3dec860ea0e890143c2f752faa57e45bdda088791","observation_id":"29ce5b87-dae4-464e-bda0-2ea07661c841","resolution":{"observed_at":"2026-08-07T11:28:59.437281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T11:26:23.203188Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02457","last_updated":"2025-06-03T05:21:51Z","snapshot_observed_at":"2026-08-14T21:56:28.538771Z","submitted_at":"2025-06-03T05:21:51Z","title":"SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:23.203188Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.02457"},"observation_digest":"sha256:298a6065a60986cd6f5070bc26670d39c67f3ba83d2aa0e6adbcd5829e91d76e","observation_id":"0db694d5-841a-41cf-99e1-1c9efe1a8c85","resolution":{"observed_at":"2026-08-07T11:26:23.203188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T00:59:48.715523Z","title":"Audiobench: A univer- sal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-16T16:08:07.333631Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.715523Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:52e9287d7972b53c6115c47b5536e4e3b27457f54c7215e1a8be0ff927746398","observation_id":"6512d42e-079e-4ed9-8525-b66be04faeb0","resolution":{"observed_at":"2026-08-07T00:59:48.715523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-06T23:41:49.687916Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-14T02:58:18.356312Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.687916Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:5c695f2faa5788bd687705f9329f74f074d62394926892f2ba463ce42f28f1aa","observation_id":"68ba51d8-c7cb-41db-bfb0-5262436c9773","resolution":{"observed_at":"2026-08-06T23:41:49.687916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-08-15T12:00:03.929140Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:de8409f615ce8d3ae8fb71eaea80aa2d4a9b3e89f3e374968bfce360d4b66a3a","observation_id":"c0e91432-1f42-4e51-96d7-0148ee36ad85","resolution":{"observed_at":"2026-05-18T05:45:56.145885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-08-15T03:10:55.387410Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:d4d60b9843bb7a5c5121610fe25a6eaeb4ab391fb70e1c0ea7a004786f3e7ec0","observation_id":"3d039abb-ea5e-429e-ae52-6d05891267e9","resolution":{"observed_at":"2026-05-11T23:16:36.090825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2605.26176","last_updated":"2026-05-25T05:37:15Z","snapshot_observed_at":"2026-08-18T23:05:42.901610Z","submitted_at":"2026-05-25T05:37:15Z","title":"PitchBench: Measuring Pitch Hearing in Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T21:05:59.172850Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2605.26176"},"observation_digest":"sha256:91adecaa31dbc7bd7883de20b07a730fdbce81b21a9f3c909a9390a1004647f2","observation_id":"8c1f157e-598f-42d7-b795-c58e8df79f59","resolution":{"observed_at":"2026-06-29T22:44:02.190822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-15T09:10:38.316635Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T19:51:59.265579Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2606.08194"},"observation_digest":"sha256:279db81b4488337ad0286020de167fc6a19fc07acb4f2c1fd00c42090c826e96","observation_id":"bf6034b7-fcef-4acd-9d12-1857c9035139","resolution":{"observed_at":"2026-07-02T21:17:24.545637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:9f53aa2f238ebd7a4b6f8d1b170c0f6df54ad54dbf32e9a368403e1a0ccd1395","observation_id":"d81f3354-8dc4-4430-bafe-563f94290b38","resolution":{"observed_at":"2026-06-30T22:15:05.582467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.16020","doi":"10.48550/arxiv.2406.16020","metadata_source":"pith","pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobench: A universal benchmark for audio large language models","venue":"cs.SD","work_id":"1c9cbc97-f341-40ec-baa5-e839fb43c489","year":2024},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-15T21:16:03.653789Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-07T14:52:35.127533Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:065c38b8f747e23ae7053d300f359314c38c54b8a1f5ab9928a4fa8235c645f4","observation_id":"8bff6c29-2a2f-4479-a0c5-a5c03635bc2e","resolution":{"observed_at":"2026-07-07T14:53:55.866469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-02T08:34:05.324498Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05364","last_updated":"2026-07-15T17:16:51Z","snapshot_observed_at":"2026-08-15T21:16:03.653789Z","submitted_at":"2026-07-06T17:40:54Z","title":"REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T08:34:05.324498Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.05364"},"observation_digest":"sha256:444b301e4e78f3a4e9a220929d045d9a069ae3bc5c786e52dafa74f4329b2cf0","observation_id":"7b4e7f6d-8971-441e-87c9-1faa15b3e281","resolution":{"observed_at":"2026-08-02T08:34:05.324498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-01T07:12:15.816142Z","title":"arXiv preprint arXiv:2406.16020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-19T18:23:07.835586Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:15.816142Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:45335f6a24359071f7eb0c86938a1aa109dae3c6bf054b06c73eda10d1bb1352","observation_id":"e5c0c47f-6b82-4139-b0e8-2c95d94bf9d0","resolution":{"observed_at":"2026-08-01T07:12:15.816142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16020/citation-record","integrity":"/paper/2406.16020/integrity","json":"/paper/2406.16020/citation-record.json","paper":"/paper/2406.16020"},"outbound":[],"paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","latest_version":5,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T06:44:38.018743Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2406.16020."}