{"as_of":"2026-08-04T22:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bca43daa6315dc963f09b4efe8466619e8915dfeffd9e91f633c12a529682a6","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T18:57:28.666194Z","state":"measured"},{"denominator":137,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":137,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":124,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:54:58.313374Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:27:36.579792Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:15379ee57db78b63e90967fc3e4eae38451683c00f179d18b5595819986ee4ea","observation_id":"1fce556b-0194-4d5f-9565-dc42f0d4f564","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:218732b8225af0a360a72b9dcbfb7385c0ac59034067e871bfc3627279357c5a","observation_id":"23e023fc-61b4-45fd-a4c8-b6b1a7d5011d","resolution":{"observed_at":"2026-05-17T00:50:13.957823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T03:53:47.396742Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2412.02612"},"observation_digest":"sha256:a95ebe2bc1a0edbac39ec7846cf2cc5d418edad71e1cb20696235b42e9a98848","observation_id":"af400f69-26f3-42aa-8581-4de09686fd5e","resolution":{"observed_at":"2026-05-16T03:53:47.586781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:eb27bd2ec1d54678a529396c9dacd7e777a5838341bc9140c65b88cb2d5127e3","observation_id":"5a11210e-e87e-4a6c-b8c7-d7f1f4be233d","resolution":{"observed_at":"2026-05-17T05:53:26.220877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:16208111c7a96163b13156f23b83b6bb6ca934f6b8afcd238b18f13fac3d6830","observation_id":"fee4a322-b101-4a6d-8353-d3e47ddd677e","resolution":{"observed_at":"2026-05-15T17:18:53.363845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:267996e6c2bc767f02ee7bc2d99ddb4f228a1a8daec82b7f8a41f6ae627403a1","observation_id":"f7f4e2d5-eef8-4afe-ac6e-be2886e2d488","resolution":{"observed_at":"2026-05-22T20:45:08.215895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:7dbbcf9e3a9b18f462aa6078257542118f37016af86aac189120ef60f2cf7fed","observation_id":"069f554c-bd79-4cfd-a636-58f85cf251ce","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.13777","last_updated":"2026-04-11T05:01:03Z","snapshot_observed_at":"2026-07-06T21:26:40.118249Z","submitted_at":"2025-05-19T23:36:04Z","title":"Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T13:38:17.640841Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.13777"},"observation_digest":"sha256:2886c8195e8444070c2f9747d519bb9541963e68f0206b90a5e7907eea8f3553","observation_id":"a68178db-90bf-4a1b-a8a9-5ee404ebe3b1","resolution":{"observed_at":"2026-05-22T13:41:36.647489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:02a0a1026ae601fe39dfe20ccc2042575705d62285cd0b83028b53c52fe97db0","observation_id":"8b25ced2-3437-4776-af5b-64709d4dc2ab","resolution":{"observed_at":"2026-05-17T03:46:06.391139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:b374af3c79b055ec4a107e14596843d789aab7353137e65134f1118d6b898842","observation_id":"2f947a66-9d89-4f63-8508-05c68e9a5cdb","resolution":{"observed_at":"2026-05-16T12:55:40.434915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2506.03610","last_updated":"2026-04-14T22:54:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T06:40:33Z","title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T12:01:42.681135Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.03610"},"observation_digest":"sha256:23eb068ec9948a105cbbc27278ee7c869e2ccc9f331136ed6ced8670da201f5d","observation_id":"bb4ccade-bec5-4864-aff7-30c54bb5815c","resolution":{"observed_at":"2026-05-19T12:02:16.689598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:21b17f11a3668c1bf1f66c0b6bdb9f2d0bd088a8750fd62e364cccbaf1c471dd","observation_id":"a85c5273-a4ad-4bb3-83da-cfd9fe8cb236","resolution":{"observed_at":"2026-05-16T05:59:50.980061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:75979878becb1bf8d0d2c9cf493a9a0e94e8a0cbaf88c11feb918832844ac6d1","observation_id":"5ba525c0-e879-4e1c-ac0c-dfc514a71efe","resolution":{"observed_at":"2026-05-19T02:41:59.607161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-07-06T22:23:05.533901Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:3eaa986558a58064f2c2a0929b29bab18084b019d9c906738c88278e292dae75","observation_id":"9459bfa7-63e8-4767-b177-81c377a0642e","resolution":{"observed_at":"2026-05-21T22:24:23.487552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T17:54:58.313374Z","title":"Qwen- audio: Advancing universal audio understanding via uni- fied large-scale audiolanguage models.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-04T17:54:55.307092Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.313374Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:a7693cb3a926f016a7b9d1d8db987daba8b065c9fd518955f6289bc276b55fef","observation_id":"208ad9f5-e36e-4155-b04d-dc81513863e4","resolution":{"observed_at":"2026-08-04T17:54:58.313374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T17:01:26.276816Z","title":"Qwen-audio: Advancing univer- sal audio understanding via unified large-scale audio- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11183","last_updated":"2025-09-14T09:29:33Z","snapshot_observed_at":"2026-08-04T17:01:25.984573Z","submitted_at":"2025-09-14T09:29:33Z","title":"WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:26.276816Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.11183"},"observation_digest":"sha256:f55e83ac927470fa2e39fe980f34412f23ff097637d3c6c30de2bf3a3418ba0d","observation_id":"a090b32a-afbd-49af-b04d-79bbb9090f89","resolution":{"observed_at":"2026-08-04T17:01:26.276816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:b3284926a648b44ec8d33fba7f28ae661311215843536e2168c522ecd0b6d55c","observation_id":"dd84d51e-7157-4d6f-a6f6-17f81ad08e06","resolution":{"observed_at":"2026-05-18T16:31:36.817162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.16248","last_updated":"2026-06-29T23:42:05Z","snapshot_observed_at":"2026-08-04T16:20:44.738594Z","submitted_at":"2025-09-17T17:15:35Z","title":"GraphMend: Code Transformations for Fixing Graph Breaks in PyTorch 2","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T16:04:29.215393Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.16248"},"observation_digest":"sha256:814b863175466d9ff74abeb628b2beecfae5a8caea4516af7c4ea76c30deeed1","observation_id":"a15dbc66-93b9-4f32-825e-c029cb124bea","resolution":{"observed_at":"2026-05-18T16:06:35.002150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T00:20:37.406351Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.17765"},"observation_digest":"sha256:791f71fdb47a642e39595312032c89f906dd2368f7d3ab2bc41d3db6989bef50","observation_id":"f87db4fa-bc05-4d2f-8cab-d25c11610b5e","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.20641","last_updated":"2026-02-02T15:29:03Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-25T00:56:35Z","title":"Investigating Modality Contribution in Audio LLMs for Music","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T22:46:49.051113Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.20641"},"observation_digest":"sha256:49e56ebde47d17d03c3c80a39a84e494a8f39a1277f1fd63563e71a36298836a","observation_id":"e78fa995-c65f-4887-8e7c-cdeffa3ff2e6","resolution":{"observed_at":"2026-05-21T22:50:43.452848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T11:23:17.996500Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:17.996500Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:8ccfd6d1d384e3d9ca6f412b972c4c7dde01070bd117b8ea184143f450d71b60","observation_id":"89840c29-ad96-42f3-868b-da8d84e3413b","resolution":{"observed_at":"2026-08-04T11:23:17.996500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T10:13:42.017859Z","title":"Ding Ding, Zeqian Ju, Yichong Leng, Songxiang Liu, Tong Liu, Zeyu Shang, Kai Shen, Wei Song, Xu Tan, Heyi Tang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11098","last_updated":"2026-07-06T08:06:32Z","snapshot_observed_at":"2026-08-04T21:47:58.063486Z","submitted_at":"2025-10-13T07:45:52Z","title":"VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:13:42.017859Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2510.11098"},"observation_digest":"sha256:3dfed105da31cd02340f23fd55e0e08161388934e8a2124ea20fcba92ba124c7","observation_id":"b1907409-d87c-48d9-8cde-3c07821ebec5","resolution":{"observed_at":"2026-08-04T10:13:42.017859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2511.09282","last_updated":"2026-04-11T11:33:33Z","snapshot_observed_at":"2026-08-02T09:37:12.651192Z","submitted_at":"2025-11-12T12:49:30Z","title":"End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T22:44:49.949759Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2511.09282"},"observation_digest":"sha256:c69f8c21bc9cacbe77eda3416a232aa4cf377791ed2bd5a9ef0c6c859015f379","observation_id":"a0e35937-98ce-43e6-bdbc-85b965b995a4","resolution":{"observed_at":"2026-05-17T22:45:24.311935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2512.01512","last_updated":"2026-04-13T14:21:57Z","snapshot_observed_at":"2026-07-30T01:31:44.078208Z","submitted_at":"2025-12-01T10:39:12Z","title":"MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T03:15:04.685150Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2512.01512"},"observation_digest":"sha256:e11fb41d787ef25d42d613c82649dab23475307b0e28822f16753b51d3cdbd2f","observation_id":"5a4f7985-4e58-499b-94de-6d9b360f85cf","resolution":{"observed_at":"2026-05-17T03:18:57.209538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T18:48:53.066189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03553","last_updated":"2026-06-03T10:10:35Z","snapshot_observed_at":"2026-08-03T18:48:50.639162Z","submitted_at":"2025-12-03T08:20:58Z","title":"Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:48:53.066189Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2512.03553"},"observation_digest":"sha256:ad79bd1d51b386cd57f367358e48bc6df8c1e5b33d16affbfe12123e05d1e5a5","observation_id":"b2fca029-712f-4cfe-9d69-cc6c5f6b7842","resolution":{"observed_at":"2026-08-03T18:48:53.066189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T12:49:50.056919Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.056919Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:24eb848cdf745281db74f2b59a2988cbaf9dedb39615463b78c235afaf3a15cb","observation_id":"938d5d20-137b-438b-92bb-7c6fc392fde4","resolution":{"observed_at":"2026-08-03T12:49:50.056919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T12:01:59.150857Z","title":"Qwen-audio: Ad- vancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-03T12:01:57.439695Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:01:59.150857Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:82ebc5113f62ae33abd52d8e86d54a4ea5bd020e148f546fba37eee14b851ba4","observation_id":"82d211a8-aba7-478b-aa7b-03ef17f646a1","resolution":{"observed_at":"2026-08-03T12:01:59.150857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2601.12248","last_updated":"2026-05-10T16:47:20Z","snapshot_observed_at":"2026-07-06T22:42:03.665045Z","submitted_at":"2026-01-18T03:55:28Z","title":"AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:17.935630Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.12248"},"observation_digest":"sha256:0f485f5a382fc53d2fb341a0c29c6e3c978e2794fbd1c08bad18250110d92785","observation_id":"b4e00556-f75b-4533-98b7-ea35e4ccfbd6","resolution":{"observed_at":"2026-05-16T14:07:58.679402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T06:23:42.307716Z","title":"Qwen-audio: Advancing univer- sal audio understanding via unified large-scale audio- language models.arXiv preprint arXiv:2311.07919,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02557","last_updated":"2026-05-29T23:48:47Z","snapshot_observed_at":"2026-08-03T06:23:40.878064Z","submitted_at":"2026-01-30T14:23:50Z","title":"The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:23:42.307716Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2602.02557"},"observation_digest":"sha256:5ad63e076a765d7e708519379af834b9b2df1afe2f7108861d4ff8dd52040e57","observation_id":"915656ab-cbcd-4b88-b8c6-f189a0119684","resolution":{"observed_at":"2026-08-03T06:23:42.307716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T04:37:50.902443Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18452","last_updated":"2026-06-29T11:58:47Z","snapshot_observed_at":"2026-08-03T04:37:48.911061Z","submitted_at":"2026-02-04T13:25:47Z","title":"RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:50.902443Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2602.18452"},"observation_digest":"sha256:40bb87dc9814a2d2e96dd55ddf72313e2cb2a5c756926d6734c5c6efd8cf95d8","observation_id":"736bbc75-f1be-4855-a73d-8c2fb4eef428","resolution":{"observed_at":"2026-08-03T04:37:50.902443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-02T09:54:13.118919Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:a28aff9812e068b13b0cc1fc200e1c5174a3aa8173d32c743cbec24684923d46","observation_id":"4eaee3f0-f2e7-4f2a-89ec-0f84c995de76","resolution":{"observed_at":"2026-05-15T15:41:12.014149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-02T18:42:05.405658Z","title":"Qwen-audio: Advancing universal audio un- derstanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07025","last_updated":"2026-07-24T15:35:47Z","snapshot_observed_at":"2026-08-03T04:43:50.232645Z","submitted_at":"2026-03-07T04:09:47Z","title":"Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:42:05.405658Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2603.07025"},"observation_digest":"sha256:9d4a2290c7315f3b84c769a414cee44273f0b3d0f2b99c741c2e45b86cdd26b3","observation_id":"dec17be9-5a17-4f83-abe7-6e3b2f56bacb","resolution":{"observed_at":"2026-08-02T18:42:05.405658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:ab872099acc5a0abd1aece10f122fea8f73046266f67c6ddef0fd42fe8d951b2","observation_id":"c879398c-5410-45c8-b011-e0edb2ffcbaa","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.09121","last_updated":"2026-04-14T06:45:50Z","snapshot_observed_at":"2026-08-02T20:05:01.635841Z","submitted_at":"2026-04-10T09:02:42Z","title":"Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:22:08.670559Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.09121"},"observation_digest":"sha256:eff8805f7b7f35f31dd5755121494a5be63baa12d6045876ea1c821ca3a86e97","observation_id":"290cb93c-7d3d-4bcb-bfbd-7e3b0930fc6b","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.10438","last_updated":"2026-04-12T03:29:14Z","snapshot_observed_at":"2026-08-03T03:39:04.776753Z","submitted_at":"2026-04-12T03:29:14Z","title":"Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:31:50.670807Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.10438"},"observation_digest":"sha256:9b6eec4a40a297545aef1e2b246f7eaaaeec87961307155ab82e502b70b88d86","observation_id":"e9a965b2-0d0a-4ef0-9396-243c375e80d4","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:823d94236ca400363fdcaadcabbdce518370e5a119e46fff9bb4deb5740b9890","observation_id":"bd9ea5f8-f59b-491e-ad1c-ff72371925c7","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.11594","last_updated":"2026-04-24T06:36:24Z","snapshot_observed_at":"2026-08-02T02:42:26.875995Z","submitted_at":"2026-04-13T15:06:05Z","title":"HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:27.118694Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.11594"},"observation_digest":"sha256:0107f19426f2d9bf661657087a4ac471b96c2c6340abae6696371342c07de377","observation_id":"c749619a-078b-4728-8ab2-c3c25b7369e6","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.13023","last_updated":"2026-04-14T17:57:01Z","snapshot_observed_at":"2026-08-03T18:18:13.717802Z","submitted_at":"2026-04-14T17:57:01Z","title":"SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:54:52.275011Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.13023"},"observation_digest":"sha256:8799af72db12d9bf4f59426f4f60f1e14e98b3d66fa8d44357aa55dee3fb4ad0","observation_id":"c3034d23-7de3-4507-864f-79a5b5ad6212","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.13715","last_updated":"2026-04-15T10:50:29Z","snapshot_observed_at":"2026-08-03T11:14:47.252184Z","submitted_at":"2026-04-15T10:50:29Z","title":"Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T12:37:17.843365Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.13715"},"observation_digest":"sha256:839db20944cb6b0783fcb02b53a336daff0caa4ae2adda1df36ac4d2d93f5128","observation_id":"b52494af-c2e3-4ba0-853e-437c93d78287","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.13804","last_updated":"2026-04-15T12:39:03Z","snapshot_observed_at":"2026-07-06T23:01:41.643335Z","submitted_at":"2026-04-15T12:39:03Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:25.660785Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.13804"},"observation_digest":"sha256:c3bdbc3e99eaee0b20847165404d0bfd12276493ced675f93e9771574cbe006c","observation_id":"8379af5e-6e66-4f3f-ad8f-1aa9fea82c16","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:d93d79caafa9d12e7d3ff8de740e2dedf517afc29f67686130c92e2222344d52","observation_id":"7547d7e1-6daa-43f2-8e63-084d53cb4443","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-01T20:57:25.785838Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:cc811ea7e76f99e40c69c76dcff6922b2b8553b7981de4e94409909ec5e5f645","observation_id":"5b6f4c32-1675-40bd-987f-f73297d3e4fa","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:11:22.402552Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.15804"},"observation_digest":"sha256:bae949f7fa4697d809ac32a0ce2d4a90c08cd119b101a9dcb3d09128b9c4a8a3","observation_id":"70ea96b3-229c-4098-bf72-f96e84c1f355","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.15849","last_updated":"2026-04-17T08:57:44Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:57:44Z","title":"TinyMU: A Compact Audio-Language Model for Music Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:17:23.740979Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.15849"},"observation_digest":"sha256:50d11b96ed55e9543cf60e78af0abe7240e4707e8d084a8178917fd67567c3fc","observation_id":"d0052591-51b9-4b3f-9b14-905b6495f83f","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-07-12T18:59:37.538555Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T03:23:40.993175Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.18360"},"observation_digest":"sha256:52ae6af21fe9a3199d913d5eb10833efcbea2a3e5f60c0f2746cef6c5dfbcd39","observation_id":"95e3d43a-fc71-4bc5-87b6-3b5faa34f5a9","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.19300","last_updated":"2026-04-21T10:05:28Z","snapshot_observed_at":"2026-08-03T21:49:52.344628Z","submitted_at":"2026-04-21T10:05:28Z","title":"HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T01:34:54.375266Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.19300"},"observation_digest":"sha256:5f53e6f1db8f59029ab7ccfa64a1067d9bfbb8a6ceccd9eac85daade32e9534f","observation_id":"2edfa591-0bad-47f3-b02a-3ae6c8c974dc","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.19949","last_updated":"2026-04-21T19:54:54Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T19:54:54Z","title":"Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-10T00:34:30.978387Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.19949"},"observation_digest":"sha256:183ae685515e9ad078b18732157469c355a125a0dc6c93e547433f8b0d71cb4e","observation_id":"e5ad04c3-579a-43ea-aa50-76833e525b9c","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.20719","last_updated":"2026-04-22T16:06:48Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:06:48Z","title":"ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T23:03:01.356594Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.20719"},"observation_digest":"sha256:0d8f724771997ced68fb3423ce2d0eafe657f7ce8d0049fa412fa8aad2deba2a","observation_id":"fda59e30-64c1-4c59-bba0-294afcb332f5","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.22817","last_updated":"2026-04-14T20:56:24Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-14T20:56:24Z","title":"In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:50.524448Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.22817"},"observation_digest":"sha256:1d1e980b4eb0c798449bdc16301394d471d11daa78e457fa8c1fdefd19d7d0a8","observation_id":"2c5cbd56-3b87-4777-9b2b-6e83b530d87e","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:cfb5d2a17e010369e6ad471c65b6350188f784331e594a1134d7f005fbef7a2d","observation_id":"abfbf2bf-15ea-4e16-bd20-bb0be9f09530","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.06126","last_updated":"2026-05-07T12:31:22Z","snapshot_observed_at":"2026-08-03T10:59:40.481635Z","submitted_at":"2026-05-07T12:31:22Z","title":"AffectGPT-RL: Revealing Roles of Reinforcement Learning in Open-Vocabulary Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T07:25:42.870223Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.06126"},"observation_digest":"sha256:8aafd725cb8b98f2d2e907eb26a614e79babc730df8a292fad6cadc618b13a8f","observation_id":"bdaf2b62-393c-44b1-885c-7505b775a31c","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:adaf7dae448bd473c1dfa3adcdb185dcf111e255da20847fab7a65c0717eeb71","observation_id":"9e68c7f7-ce71-4e29-b9ae-f44abb081e5c","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.06897","last_updated":"2026-05-07T19:57:39Z","snapshot_observed_at":"2026-07-06T23:19:20.674889Z","submitted_at":"2026-05-07T19:57:39Z","title":"MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-11T01:14:43.744389Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.06897"},"observation_digest":"sha256:9476c073cf12a984cc0ef249ebca4d17378dc9b809a63e213daf906d145c26c1","observation_id":"5729abf1-bc37-4611-9f1e-e94c51ac38bf","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.10203","last_updated":"2026-05-11T08:49:26Z","snapshot_observed_at":"2026-07-29T20:41:29.988615Z","submitted_at":"2026-05-11T08:49:26Z","title":"Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-12T05:15:55.193062Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.10203"},"observation_digest":"sha256:4c218ec18f99eff4abaab2b21ecd37f166e9ce7a150d036c3fefa8bad241ec51","observation_id":"f5cc76f9-0d30-4fda-a649-90c29cfca4d9","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.13651","last_updated":"2026-05-13T15:09:47Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:09:47Z","title":"NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-14T18:16:22.762405Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.13651"},"observation_digest":"sha256:e3ae2e8130316ab63674fcb63f8b0c014586a78ca103f7ff68f651e28f11aa9c","observation_id":"620ffce7-c856-4ca7-9bb0-3c8f10fadcb3","resolution":{"observed_at":"2026-05-14T18:17:35.034442Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.15044","last_updated":"2026-05-14T16:36:57Z","snapshot_observed_at":"2026-08-02T23:03:08.998549Z","submitted_at":"2026-05-14T16:36:57Z","title":"SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T03:20:37.488507Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.15044"},"observation_digest":"sha256:bfc7bcdb73bc44f10cff5c88062d54f5fe2d2379455a66f5f9486be796161dc7","observation_id":"cdc99437-c98d-415e-b494-73f7e9b21483","resolution":{"observed_at":"2026-05-15T03:24:55.762374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.18104","last_updated":"2026-05-18T09:16:55Z","snapshot_observed_at":"2026-08-02T08:21:56.104408Z","submitted_at":"2026-05-18T09:16:55Z","title":"Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T10:57:40.997128Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.18104"},"observation_digest":"sha256:7f78856bf062e24afb18e757cdd4891001d5458f617b7d1db27bd06538527dd4","observation_id":"df4a1cc0-e0b4-4445-bf82-31cf959c3e95","resolution":{"observed_at":"2026-05-20T10:58:13.582853Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.18194","last_updated":"2026-05-18T10:32:56Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:32:56Z","title":"Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T10:10:31.059095Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.18194"},"observation_digest":"sha256:0c2437450d6bec0e1f7cdf9e56658e0ae7afb5bfe7ab0c8b677034f23af5b204","observation_id":"1e53ada0-156c-4bd4-97c7-dbbb9a207388","resolution":{"observed_at":"2026-05-20T10:13:11.904848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.19101","last_updated":"2026-05-18T20:41:08Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:41:08Z","title":"Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T07:13:29.041056Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.19101"},"observation_digest":"sha256:b78847002f3e7d2ccadd5ddb4a6108019afece01a117c3c2d94c76c8c06d3853","observation_id":"9e8fa346-5ab2-42b9-a605-1bb28993f172","resolution":{"observed_at":"2026-05-20T07:18:07.283584Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.19950","last_updated":"2026-05-19T15:05:00Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:05:00Z","title":"AffectVerse: Emotional World Models for Multimodal Affective Computing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T06:46:33.612905Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.19950"},"observation_digest":"sha256:6037f4c99d4d5f85ea71a05a955b6f3c33425ac79a88f9491ad603f6e49ef539","observation_id":"4f00b568-ccd7-42fa-9273-d5de3b870bea","resolution":{"observed_at":"2026-05-20T06:48:05.771479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:bfe817a523d9ff9c5574ac5e05d23d1fd0c061805c10ad097a5fa235f60643c9","observation_id":"eb3712d9-5bb2-4d85-8236-08592f036432","resolution":{"observed_at":"2026-05-21T07:39:49.032020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T06:43:52.735211Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:97ffa51c8f24fdd497364c87c9ee421682524d33bb3fb2b9870112618754aeb8","observation_id":"d0601d4d-da6c-4519-8b2d-1c2ceed0618d","resolution":{"observed_at":"2026-05-21T06:44:00.638652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:46.831360Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:18f215362b6e327e2a08a625dc0c982c481153c8f19e5b6c611a7b2e51645637","observation_id":"479df41f-2545-4208-89ef-c1e4ca2aa2a3","resolution":{"observed_at":"2026-05-25T05:45:23.736609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.21538","last_updated":"2026-06-23T07:00:03Z","snapshot_observed_at":"2026-07-06T23:31:56.199912Z","submitted_at":"2026-05-20T07:18:24Z","title":"Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T01:38:39.499793Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.21538"},"observation_digest":"sha256:c26e00febf46e69092418726d0d50ed49a19fc337331426ea20b1233046ce432","observation_id":"7f4ccaf0-1710-4abd-8708-534d46d21743","resolution":{"observed_at":"2026-05-22T01:40:53.973928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.21538","last_updated":"2026-06-23T07:00:03Z","snapshot_observed_at":"2026-07-06T23:31:56.199912Z","submitted_at":"2026-05-20T07:18:24Z","title":"Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T17:37:57.477175Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.21538"},"observation_digest":"sha256:5ea5998e2d2c69a38e50008305423c9276a42a85584ddc5fdfa44378070064ec","observation_id":"5c25e27e-88b1-45a4-872a-19bd9b4dd46c","resolution":{"observed_at":"2026-06-30T17:44:57.896841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:33bc8807a22764fbf4a84fb95719ad8cc6510f016b5329d5e4414a3683acecea","observation_id":"740e0a2d-bb52-478b-b45b-c7f7d49cb0e8","resolution":{"observed_at":"2026-06-29T23:04:01.933661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.27190","last_updated":"2026-05-26T15:43:11Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T15:43:11Z","title":"Learning When to Think While Listening in Large Audio-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:37:34.409802Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.27190"},"observation_digest":"sha256:dbcfaca819190dcaf95053a1465002c49d99e536323f8f3a72e188c6857541e4","observation_id":"da3ac5f8-e845-4de2-bfd5-97485eec1690","resolution":{"observed_at":"2026-06-29T18:43:50.761327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.28642","last_updated":"2026-05-27T15:47:33Z","snapshot_observed_at":"2026-08-02T18:33:04.456837Z","submitted_at":"2026-05-27T15:47:33Z","title":"Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T11:40:46.165547Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.28642"},"observation_digest":"sha256:43ee70b05211048301443f0a283134fefc223cc30e79a4ea84539428fa32f4e3","observation_id":"0bc2763b-f789-42ea-9194-ebae95b4c9f7","resolution":{"observed_at":"2026-06-29T11:43:23.632863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.29613","last_updated":"2026-05-28T08:48:56Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T08:48:56Z","title":"Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:45:19.762023Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.29613"},"observation_digest":"sha256:6e6d766d3e74fffdaa0fa806461a72b1eeedc70389d04736232a8cd0eaea7223","observation_id":"9d928bee-1a71-4611-b74a-b293c28cb711","resolution":{"observed_at":"2026-06-29T05:53:09.221791Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-04T13:05:35.009507Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:cc862f027d59f7a713e606bfa45a9d46da56616b0a869cd3846d074f68017779","observation_id":"aefe8a3d-a213-4bab-a83d-2b41b781e83d","resolution":{"observed_at":"2026-06-28T20:52:37.927179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.00460","last_updated":"2026-05-30T00:54:53Z","snapshot_observed_at":"2026-07-30T20:34:03.133280Z","submitted_at":"2026-05-30T00:54:53Z","title":"SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:19.422735Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.00460"},"observation_digest":"sha256:290b760e770061d5b62522e6d1da5a5c7862e10f7791a1575f413df7268f99b4","observation_id":"179085e3-992f-4d2a-ae0a-f132a28e8a89","resolution":{"observed_at":"2026-06-28T19:32:35.160558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:31cc30a799e688e7f4593876049164d6942f5c16adad7bb99db887b8521675a0","observation_id":"f4ca3108-7a9c-4749-b2ad-8a07fd214955","resolution":{"observed_at":"2026-07-02T00:56:25.088047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.03283","last_updated":"2026-06-28T12:59:22Z","snapshot_observed_at":"2026-08-02T08:17:49.710129Z","submitted_at":"2026-06-02T07:49:30Z","title":"SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T08:34:11.270002Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.03283"},"observation_digest":"sha256:58372ada281b0d9cc4919dae3b9789d775e7d49d335dff27d07b0755d85c2c6c","observation_id":"8849e7a8-7d9b-4497-bb3f-0ad7da2baa51","resolution":{"observed_at":"2026-07-02T05:06:39.874784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.03283","last_updated":"2026-06-28T12:59:22Z","snapshot_observed_at":"2026-08-02T08:17:49.710129Z","submitted_at":"2026-06-02T07:49:30Z","title":"SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T11:24:22.023188Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.03283"},"observation_digest":"sha256:10450be5eac217d796d509994e007b2d31652c179285423bb5810c2d93610439","observation_id":"723b62a9-8d87-4d49-b458-0387ac1675a5","resolution":{"observed_at":"2026-06-30T11:24:37.761323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.04474","last_updated":"2026-06-11T09:28:59Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T05:44:09Z","title":"Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:25.592270Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.04474"},"observation_digest":"sha256:56d9dd496dace9709e92b9fce69a172af9d62df550e044876a3e2c16571b60aa","observation_id":"e2bb7787-a114-40f1-8466-be63fe23eef8","resolution":{"observed_at":"2026-07-02T07:46:46.222824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.04939","last_updated":"2026-06-03T14:29:52Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:29:52Z","title":"UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T04:22:13.478562Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.04939"},"observation_digest":"sha256:13981f470469f57aa1a0069cb3be1153e62fa9e3f2a7153c9047b608cdf0f2df","observation_id":"eb536c04-8d0a-4304-9e23-2ec0aa406ed2","resolution":{"observed_at":"2026-07-02T11:16:53.506262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:f07b108c5bb8c6ac22df675efa110a601839457a2d20cbac5470fb43f392ceaa","observation_id":"a5855a8f-e10c-4cb7-bb7c-fab514158adb","resolution":{"observed_at":"2026-07-02T10:46:52.393805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.06940","last_updated":"2026-06-10T06:55:49Z","snapshot_observed_at":"2026-08-03T21:56:13.034676Z","submitted_at":"2026-06-05T06:11:38Z","title":"Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:16:07.007759Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.06940"},"observation_digest":"sha256:b91bf27b0d911fcf55fd468d530f21a7b9af0f082c52ee247a512a48bdf977e7","observation_id":"932b0ab3-6afd-45de-b862-4d56d7a095e1","resolution":{"observed_at":"2026-07-02T19:47:20.020338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.07387","last_updated":"2026-06-05T15:24:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T15:24:36Z","title":"Making the Most of Limited Data: Score-Aware Training for Text-to-Music Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T23:00:07.144841Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.07387"},"observation_digest":"sha256:312d6984d42a895e6939d6f60bfd71818ef91960032c17ec3049ea89501c94ad","observation_id":"3176a1fb-2ea5-4502-bd1c-55e08d7d8913","resolution":{"observed_at":"2026-07-02T16:07:08.932270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.08573","last_updated":"2026-06-07T11:07:30Z","snapshot_observed_at":"2026-08-01T04:00:28.663686Z","submitted_at":"2026-06-07T11:07:30Z","title":"Titans-as-a-Layer: Test-Time Memory for Conversational Speech Emotion Recognition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T18:28:44.652813Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.08573"},"observation_digest":"sha256:fac4fc3fbe57eb59cf0a61e0e3a6a4a9eb6c1abaa1285bffdb39117ffd4ba700","observation_id":"2eae3c81-fd6b-4d33-881c-12a91f9888d2","resolution":{"observed_at":"2026-07-02T23:07:26.859912Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:1321148fd7b5902771236ed311c0ce05e6773bb2260f0b4c47659cc27d8a4d41","observation_id":"4ba04366-f80d-42f3-b828-93d0309bccac","resolution":{"observed_at":"2026-07-03T01:37:30.605027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.09470","last_updated":"2026-06-08T13:27:40Z","snapshot_observed_at":"2026-08-02T04:49:53.664865Z","submitted_at":"2026-06-08T13:27:40Z","title":"A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T16:33:41.230574Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.09470"},"observation_digest":"sha256:961c8ddc5a97cd8424bc70379b932ac0267ff1862a90a77ea0c19ec8c0f6a7a3","observation_id":"c241abff-92c0-4a8e-9fa7-a78e8cf487c2","resolution":{"observed_at":"2026-07-03T01:27:30.830670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:c3a6056d29128572990b7aaa6a4c6ae1054fd948b333927c1db55a03f530bfb9","observation_id":"e4925622-4525-4f07-9bf9-2d1dc972c69e","resolution":{"observed_at":"2026-07-03T07:57:44.685719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-03T04:36:58.884789Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:fb096b77cc89b2083ef457bc737cd5b5620bcc923b93665cc82b1658e217dd12","observation_id":"b6ca04b8-b71d-4992-bd17-b1f28879ad73","resolution":{"observed_at":"2026-06-30T22:15:05.345453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.11260","last_updated":"2026-06-09T02:38:17Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-06-09T02:38:17Z","title":"RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T12:11:56.629002Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11260"},"observation_digest":"sha256:5672ca77478c45175e465f3920df39527333bea97f569904aa30687810ecba55","observation_id":"9452a331-52ee-4638-9edb-3d048f2d355a","resolution":{"observed_at":"2026-07-03T07:17:43.937486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.11385","last_updated":"2026-07-31T21:56:40Z","snapshot_observed_at":"2026-08-04T22:20:26.447164Z","submitted_at":"2026-06-09T19:08:00Z","title":"DeceptionX: From Multimodal Evidence to Explainable Deception Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T13:15:49.796647Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11385"},"observation_digest":"sha256:f0630c8e15f6fda1a34a4c5dd26ed0922d6e628e18dac06b55fc8df7f9b7d980","observation_id":"f1b06a76-9818-43c9-900a-f37b5ca039e7","resolution":{"observed_at":"2026-07-03T05:27:40.118590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T03:03:32.342985Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11385","last_updated":"2026-07-31T21:56:40Z","snapshot_observed_at":"2026-08-04T22:20:26.447164Z","submitted_at":"2026-06-09T19:08:00Z","title":"DeceptionX: From Multimodal Evidence to Explainable Deception Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T03:03:32.342985Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11385"},"observation_digest":"sha256:6d38853f04e5f15d7458d2185e9700d393144432d08a18c0606ee3b0697f6b55","observation_id":"9b7135e4-56ed-4edb-95a9-bb132db28181","resolution":{"observed_at":"2026-08-04T03:03:32.342985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:fe3d15193949d77bd9824ac8054318471c21fc651bf8b989dbdc3fb96519cfc3","observation_id":"ac7ff34f-1db1-4410-b224-25bed8213b59","resolution":{"observed_at":"2026-07-02T17:47:18.010086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.21854","last_updated":"2026-06-20T03:21:57Z","snapshot_observed_at":"2026-08-02T18:16:50.732892Z","submitted_at":"2026-06-20T03:21:57Z","title":"ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T11:54:08.457573Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.21854"},"observation_digest":"sha256:089ea37cee4203dad3c3d9fc497c22af15671a124d567b21fa6f99da847293a2","observation_id":"619b0362-c950-408b-be0b-f8183fec4b63","resolution":{"observed_at":"2026-07-04T08:19:44.206175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.23313","last_updated":"2026-06-22T13:26:29Z","snapshot_observed_at":"2026-08-01T15:51:02.528612Z","submitted_at":"2026-06-22T13:26:29Z","title":"Uncertainty-based Debiasing and Unlearning for Decontamination","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T05:57:44.576411Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.23313"},"observation_digest":"sha256:0df36f3713ee52a10c870be6863d11558e4c808fcced42caa8c68bd4b0ae50a6","observation_id":"0b2d104a-d72a-4026-8a0a-2d0483a7cfd6","resolution":{"observed_at":"2026-07-04T12:49:52.436103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:21f30382c84c9ce2213ff438ad211b91883508da06fb377e0b5201bf8836b756","observation_id":"5ea7e87f-1ab4-41c0-9425-0c9ebd3b1236","resolution":{"observed_at":"2026-07-04T19:20:06.521202Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.25436","last_updated":"2026-06-24T05:57:45Z","snapshot_observed_at":"2026-08-01T06:38:21.357775Z","submitted_at":"2026-06-24T05:57:45Z","title":"Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T20:08:33.322532Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.25436"},"observation_digest":"sha256:18d55fda7ba3f21c8329d61d8e6833c7c7634f177d7407710856eee78f255d59","observation_id":"4fb3ee76-5ee9-4a24-9bed-c477ba7f6356","resolution":{"observed_at":"2026-07-04T20:30:07.197249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.25444","last_updated":"2026-06-24T06:15:18Z","snapshot_observed_at":"2026-08-02T19:50:32.355214Z","submitted_at":"2026-06-24T06:15:18Z","title":"Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T20:03:10.858349Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.25444"},"observation_digest":"sha256:2daa6ecca054e2335b7bba72b984150791da20b627e0a1fb6521029e5b16202c","observation_id":"4d7d6bd8-907e-4ffd-8ad1-d78f8f3a39b2","resolution":{"observed_at":"2026-07-04T20:30:08.192339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.26824","last_updated":"2026-06-25T10:04:35Z","snapshot_observed_at":"2026-08-04T03:38:31.867526Z","submitted_at":"2026-06-25T10:04:35Z","title":"wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T02:49:35.819155Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.26824"},"observation_digest":"sha256:57498b5f385f77cbd16a4715d6597086ea544080b2691aca31c81b49b87256d2","observation_id":"9df4c430-c924-4e36-9570-2ed681fabf5e","resolution":{"observed_at":"2026-07-04T14:39:58.377508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:cfe43133b3ef12d1edb1147c20aaf6bf7b737da30516e1464d299d47d9a2934e","observation_id":"83072bef-a268-4225-a828-3e1b98b061ed","resolution":{"observed_at":"2026-06-29T18:23:51.453211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T09:35:03.660671Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:e80a7dd553650fbad37da4d0bede1542359f75caf1bfb88547b086de69a924e5","observation_id":"a1f64d49-bfc4-47c2-8d5c-48b413637a29","resolution":{"observed_at":"2026-06-30T12:54:40.667112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-12T11:11:08.878850Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T11:11:08.878850Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:6eae6fa61d2e9f6614d0b1a9b22d4fa6f252206cd37ce6b9210c05aade2e6140","observation_id":"89de6386-c342-448a-951d-515551432d5f","resolution":{"observed_at":"2026-07-12T11:11:08.878850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.29534","last_updated":"2026-06-28T17:57:41Z","snapshot_observed_at":"2026-07-07T00:03:31.715960Z","submitted_at":"2026-06-28T17:57:41Z","title":"Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:26:38.380118Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.29534"},"observation_digest":"sha256:2977a601e95e62704aa1cb93bf4a8a0735fb0b2f24152c6e20f2e9e1619615ba","observation_id":"0891cb16-4399-4f0e-b866-501bbb99ede7","resolution":{"observed_at":"2026-06-30T07:34:21.799793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.31338","last_updated":"2026-06-30T08:39:56Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:39:56Z","title":"Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T03:31:42.611472Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.31338"},"observation_digest":"sha256:d56d78a123c6b615a4d7cb5c3511c3a5d9a39eee16a782335e4efe9d824a8909","observation_id":"cc259b6a-0406-45d8-868c-c62268c37d7d","resolution":{"observed_at":"2026-07-01T11:55:42.994017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-12T03:03:59.776103Z","title":"arXiv preprint arXiv:2311.07919 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03356","last_updated":"2026-07-03T14:14:04Z","snapshot_observed_at":"2026-08-04T10:24:04.234747Z","submitted_at":"2026-07-03T14:14:04Z","title":"CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T03:03:59.776103Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.03356"},"observation_digest":"sha256:05c09db492643024bd3d1dcb65d8e32eb110dc62112986da98498d4f7dbf8b9b","observation_id":"b8215101-0e5e-467c-8a2a-491459e6a730","resolution":{"observed_at":"2026-07-12T03:03:59.776103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.07919/citation-record","integrity":"/paper/2311.07919/integrity","json":"/paper/2311.07919/citation-record.json","paper":"/paper/2311.07919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"1a9872b0-a048-46e6-9642-6eaad358fb33","year":2016},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:e60fc1c468f1c6f9e7f4392c4f67af5fe77cf2f41cecfb4ec587533fc84551a9","observation_id":"f82b18c7-0b96-499e-bba2-fcb3970209e0","resolution":{"observed_at":"2026-05-12T18:57:28.885441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-07-10T13:57:07.008081Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:18cfba4cb69e2b104155c82c35c9e4960632df6d02b2c264fbac0dba8c88b11d","observation_id":"0b34eb66-5d5e-4197-b53c-291d3fa9631a","resolution":{"observed_at":"2026-05-12T18:57:28.779045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:9b27c49f5e31edd03d0cce3104b014db58bd492173ef60fd6c12672319df8316","observation_id":"1a9a4096-7be8-487e-bd11-85d4f50bebe4","resolution":{"observed_at":"2026-05-12T18:57:28.714811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-10T20:57:35.014119Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:0a31592e0f7a9bd7545cba1d2999bcb8d39aa4dd6d2f14bc29d77f8adc00d2e0","observation_id":"686a88c1-2cb5-4cc3-9743-96b07e7caff0","resolution":{"observed_at":"2026-05-12T18:57:28.736051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AISHELL-1: an open-source mandarin speech corpus and a speech recognition baseline","venue":null,"work_id":"6257141b-6551-418c-86f6-d9187fddd6a6","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:334c380d36580d031da30f34fadeffcbc68be813797573c737cd2f2abb3d6f02","observation_id":"978cba6e-4754-4698-89bd-496af42f7de5","resolution":{"observed_at":"2026-05-12T18:57:28.831322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:0006d2b23fa8aad2703c0a9848e2bad86d6a3046fef09e35b37cf6e94282712d","observation_id":"40075b4d-b472-4db9-9b1e-be1236df4437","resolution":{"observed_at":"2026-05-12T18:57:28.801899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03070","last_updated":"2021-05-31T11:05:43Z","snapshot_observed_at":"2026-07-06T11:07:08.503991Z","submitted_at":"2021-05-07T05:31:34Z","title":"SpeechNet: A Universal Modularized Model for Speech Processing Tasks","version":2},"cited_work":{"arxiv_id":"2105.03070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.03070","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speechnet: A universal modularized model for speech processing tasks","venue":null,"work_id":"07752b40-0b3a-4488-897a-19a69b941d9e","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2105.03070","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:401ddc41629ec6968ab65d483370b506a4e4028cfb5997f10ea79be700a8d193","observation_id":"c2e4f870-f674-4337-aaa5-83566ad92f9f","resolution":{"observed_at":"2026-05-12T18:57:28.808161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:1bacb1edd077ea2a8734ba71a5130dd0159b8d034a1e55e3b02bf68e4fbcc459","observation_id":"0389ca6e-f17d-4aec-b5e2-8381638cda49","resolution":{"observed_at":"2026-05-12T18:57:28.817947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b7f80d0d8a59ff229f0b23a2cb9b2c33cf3a2a3b8b66533c75c1b147e3b94199","observation_id":"513cee5e-03c7-4c91-98bd-c697f2efda83","resolution":{"observed_at":"2026-05-13T21:49:52.306785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clotho: an audio captioning dataset","venue":null,"work_id":"e98e70a4-c0dc-4ace-af67-bfffb1c668ef","year":2020},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:bf5aebedbcdacd87a3b4784f47f0f5404033de08a66f98efdb094fc6f21b02e0","observation_id":"527b4f02-96cd-4cc8-b586-ec04dde22436","resolution":{"observed_at":"2026-05-12T18:57:28.835232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":"1808.10583","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-07-05T13:21:06.309631Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","venue":"cs.CL","work_id":"123cad45-dfd0-4b02-a99a-47d962dc2ab4","year":2018},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:bba71aa30f5fcaede9389f29e94dd37c96d02fb0a074e6038771b7a5fa199717","observation_id":"68ff7646-e1bf-41d7-bcfa-203ecfe6a788","resolution":{"observed_at":"2026-05-12T18:57:28.720600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04769","last_updated":"2022-06-09T21:16:10Z","snapshot_observed_at":"2026-08-04T21:36:01.107247Z","submitted_at":"2022-06-09T21:16:10Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2206.04769","doi":"10.48550/arxiv.2206.04769","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04769","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Clap: Learning audio concepts from natural language supervision","venue":null,"work_id":"983269ec-ba9c-4b46-92ae-314e1b52c693","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2206.04769","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b939e0a6891b675b02f955db2374fdd4c39641c5f2b9c9e63ebb47f52d6d884e","observation_id":"6f5b030d-787a-4213-8656-d5a8ac082472","resolution":{"observed_at":"2026-05-12T18:57:28.731393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engel, Cinjon Resnick, Adam Roberts, Sander Dieleman, Mohammad Norouzi, Douglas Eck, and Karen Simonyan","venue":null,"work_id":"e3d8d41c-9929-4e7b-a249-d184c6caa04b","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:519f506d83f259975078358738ae8c8e27dcbfc3a9e26c3c95569b31a5ac369a","observation_id":"8797769d-2f3c-4613-9ead-011e07268843","resolution":{"observed_at":"2026-05-12T18:57:28.838846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:e8fd56d5eea593582f13510e714810c0c48b61c89ddaee7e55b0abd45cc9b56b","observation_id":"3ad2844e-c9f5-4714-bff0-1a4b7959d5fd","resolution":{"observed_at":"2026-05-12T18:57:28.775426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vocalsound: Adatasetforimprovinghumanvocalsoundsrecognition","venue":null,"work_id":"6af9ba3b-d108-4c7e-b927-2047ba7498dc","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:3f4d876489569a528045348309ce2566b5455fe98c0f239cf702a7e919b65148","observation_id":"36888e76-61f8-40ff-8187-3bcc31335b98","resolution":{"observed_at":"2026-05-12T18:57:28.845340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3922.2022","doi":"10.1109/icassp43922.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"author Zhou, A","venue":null,"work_id":"ad61b46b-30ce-4e77-9b24-298e8b28f2dd","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:e13dfda3d6709cc28e64fd0a93741ac33135d71eb4427a134ccdfcc45fd24fd6","observation_id":"f7b85189-ba7f-4e93-8573-4e11a561165d","resolution":{"observed_at":"2026-05-12T18:57:28.701257Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T00:50:01.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T00:50:01.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:2aecbf7ea9dd79f82f12a89aab71bdab2c0bc74ae0fe68155d64cdb693f13568","observation_id":"2af46fc4-917a-4c63-8f0e-57d6da47ab1e","resolution":{"observed_at":"2026-05-12T18:57:28.783179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-08-04T09:21:35.342211Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":"2304.12995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"d9cf9bad-35d2-4253-bdaa-b464fbb89733","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b47c6646c72fe60e6a0a7e914b9cf16d1f2710b0ffc09b4fbe6414c6e97b2340","observation_id":"fe563662-f13d-4f5b-860d-d8d85889f490","resolution":{"observed_at":"2026-05-12T18:57:28.789265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02289","last_updated":"2022-11-04T07:01:16Z","snapshot_observed_at":"2026-07-06T14:14:23.751937Z","submitted_at":"2022-11-04T07:01:16Z","title":"CochlScene: Acquisition of acoustic scene data using crowdsourcing","version":1},"cited_work":{"arxiv_id":"2211.02289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.02289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cochlscene: Acquisition of acoustic scene data using crowdsourcing","venue":null,"work_id":"c501096d-d905-44d4-8bc7-3f3a8bd6df2b","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2211.02289","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:abca6a7217bed24eae843e4fed48339ee8ff4ffc301a95e4c3749568b889f926","observation_id":"06221470-b5d6-497b-bdc2-9c210a4d8566","resolution":{"observed_at":"2026-05-12T18:57:28.796789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fcf12750-6357-4d4a-8c99-779a5f3bb86c","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:35fad157cc0f676b93ae8ddaa55b93c4e87cb9153aff8bfefdab79c4ca085aa2","observation_id":"59b741bb-9023-4ffb-849d-3efec1ae8228","resolution":{"observed_at":"2026-05-12T18:57:28.849814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clotho-aqa: A crowdsourceddatasetforaudioquestionanswering","venue":null,"work_id":"f19553ff-321c-4b1e-81a1-8544da7b3af4","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:ecf766dcc69dd151afaf2df061bdd1690acb6ccfeb51fcdbe5706ae56917f858","observation_id":"85bb758f-2015-4066-8751-0af96520986f","resolution":{"observed_at":"2026-05-12T18:57:28.859905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:2a9ccb14711b6a0eaba016f6bac3a53447b919624f4dba3d5627930900097f0a","observation_id":"0e5f935e-91f7-42dd-90d9-b091d4afbb92","resolution":{"observed_at":"2026-05-12T18:57:28.813519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07937","last_updated":"2024-01-24T15:36:31Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T03:13:18Z","title":"Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks","version":3},"cited_work":{"arxiv_id":"2309.07937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07937","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks","venue":null,"work_id":"f014baca-7e3d-4528-a8d6-8117be741f4d","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2309.07937","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:d2ab14acfbfd37bd451db32fb962ee440604ade98f38a573adc7b2ea8dea99f8","observation_id":"8f2a679e-c6bd-4afd-850c-f503f410178f","resolution":{"observed_at":"2026-05-12T18:57:28.823612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Montreal forced aligner: Trainable text-speech alignment using kaldi","venue":null,"work_id":"971ca3e4-1375-4fb7-a3b2-37228cbfee8f","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:ce261af3849ad9464981ec4e27475f7396b210f5b83c99863efd2a1298e016e7","observation_id":"86c9db3c-e837-44ff-a9fc-598806601471","resolution":{"observed_at":"2026-05-12T18:57:28.863538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DCASE2017 challenge setup: Tasks, datasets and baseline system","venue":null,"work_id":"56f6a313-818e-40b7-9eac-ae646305fdc8","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:053fc9b679b3e6ed731e9dd15092016831b71abe13d4f54635180a5613203896","observation_id":"9138ff39-1341-42d4-9330-8c7a9faac660","resolution":{"observed_at":"2026-05-12T18:57:28.866991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Librispeech: AnASRcorpusbasedon public domain audio books","venue":null,"work_id":"2fc2fc79-b914-4b7a-9a8a-80a5bca138de","year":2015},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:82074d92151136388c0b7136b07a215fab6622cefebf569e3afb19ebc0f186d5","observation_id":"7d1d4f61-5064-42a0-8e1d-3aa78034ab6a","resolution":{"observed_at":"2026-05-12T18:57:28.870304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D","venue":null,"work_id":"dbe882cf-1795-4034-8bc4-89ec2d2ab389","year":2019},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:45e9f749e9f789e4a1b3bc3751397a098817b742ce997f2ab9636b12c58a973b","observation_id":"24f53383-474b-4b6d-b5df-d15bf63ea882","resolution":{"observed_at":"2026-05-12T18:57:28.873606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-07-10T06:36:52.542747Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:2c9d998904e4cd64ce454c55483fe2e0e6726cf917f30660c1d22fa25ee3e0a4","observation_id":"4578af68-d155-46d8-8b0e-6e1618754984","resolution":{"observed_at":"2026-05-12T18:57:28.726199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":"d2f7dc48-9381-4c73-ab96-6c09344f3c8f","year":2019},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:14817f0e86e4416f74ff712ea66169eb54d44a7fa2c4b2249f0cccef6cbd5a33","observation_id":"1b0ec48a-8858-49fd-8f34-0c73b749ae2a","resolution":{"observed_at":"2026-05-12T18:57:28.876807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever","venue":null,"work_id":"8c059412-b524-4524-bc94-ad2c6dbac786","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:677d59298ab0e15bfdbf75e8fb11800e84a5a189b7e880907fb835bee8471938","observation_id":"5fe6b423-28aa-4c97-9865-085fe94460da","resolution":{"observed_at":"2026-05-12T18:57:28.880806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":"2303.17580","doi":"10.48550/arxiv.2303.17580","metadata_source":"pith","pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","venue":"cs.CL","work_id":"f20ed1da-2676-4598-a11b-54549718735b","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:feb4b2daf1361c6d6ae1f83a0d20bb1f108491c7e5f5242dbce3faac6435e291","observation_id":"fb10e4d5-8f2d-43af-8bde-5bdd7fc47cd6","resolution":{"observed_at":"2026-05-14T00:06:45.816188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:34.235168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:34.235168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15930","last_updated":"2023-09-16T06:14:54Z","snapshot_observed_at":"2026-08-03T12:20:32.037666Z","submitted_at":"2023-08-30T10:12:39Z","title":"LLaSM: Large Language and Speech Model","version":3},"cited_work":{"arxiv_id":"2308.15930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.15930","snapshot_observed_at":"2026-07-03T01:37:30.579102Z","title":"LLaSM: Large language and speech model.arXiv preprint arXiv:2308.15930","venue":null,"work_id":"2959c7f3-e690-4086-b347-09ba2e8f3989","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2308.15930","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:6f738d9df436b478d05d923e5e8eb9cdd29a89180f15bd2bb862159f5bfe1d50","observation_id":"2bcc33b7-1fb3-4b57-ad7c-82fe00b902f9","resolution":{"observed_at":"2026-05-12T18:57:28.748529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-07-06T15:52:36.416440Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":"2307.05222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-04T10:09:44.721463Z","title":"Emu: Generative Pretraining in Multimodality","venue":"cs.CV","work_id":"d20ff802-68ef-4783-943f-7bf17acb6a68","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b057a64547bc60b9a72d3acb43e7d949ef49406db8cebe3cf58dca97a53d41fb","observation_id":"d1b73c67-50be-45a3-9491-94e911eddeed","resolution":{"observed_at":"2026-05-16T20:22:11.462164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:2a312718542dd5129cbba139ccc36858a897d2d40e32c24695b4c0d88a06dab6","observation_id":"0877f768-621a-4a4f-a3aa-e5cdd7c7ac10","resolution":{"observed_at":"2026-05-12T18:57:28.757812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:1ae7e7d97f69031e353f645a926de65fbe8a58e22284115455f848cc095cea13","observation_id":"492184fe-5f82-4b06-a1a1-3b6b33fe2ea8","resolution":{"observed_at":"2026-05-12T18:57:28.762806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":"2305.11000","doi":"10.48550/arxiv.2305.11000","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"003168ec-b0d0-4979-830c-7df75e11d84b","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:74c35b7aa9e53ea9e6bf78530db703f46c5d3f9ca4b45acb65c7099869b65d31","observation_id":"e09f75fc-0890-4b05-b290-52f56213f9f7","resolution":{"observed_at":"2026-05-12T18:57:28.769454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Whisper-large-v2 Qwen-audio 1st-stage LLM init","venue":null,"work_id":"94fb6db7-2e38-4838-93f9-cd1e0b97a27a","year":2000},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:fb1d41b0f474a63764397ee8961d1edaa0a4e5d28858d53ac2af2500c9694a22","observation_id":"fe3be170-510f-402f-8ce1-f13f025a6ccb","resolution":{"observed_at":"2026-05-12T18:57:28.827623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":21,"verified_fuzzy":13},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 100 inbound Pith citation observations for arXiv:2311.07919."}