{"as_of":"2026-08-15T23:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47eaf6805333c9acfdd92b0ce9a8a6dc21679b56df102950f1830c4d53753617","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:04.010212Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.101657Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:52.814698Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2505.14226","last_updated":"2026-04-07T12:14:38Z","snapshot_observed_at":"2026-08-08T04:00:07.253604Z","submitted_at":"2025-05-20T11:35:25Z","title":"Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T14:40:58.506345Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2505.14226"},"observation_digest":"sha256:da80f14541cff29cf0839e9401e129ef357b73a533dd9507e470ec49df2590bf","observation_id":"b787ab99-1793-48c0-a3fd-44975853b2ca","resolution":{"observed_at":"2026-05-22T14:41:41.447184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-08-06T20:01:29.101657Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-15T03:26:10.551833Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.101657Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:dddbeadb3c0b495ec994f4d2b72604ca1ec95fef7debce57036479dcc878032e","observation_id":"3c24cbcf-69cf-4df7-b40a-5d88ccaa7dba","resolution":{"observed_at":"2026-08-06T20:01:29.101657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-08-03T11:56:08.058417Z","title":"Zhe Sun, Yujun Cai, Jiayu Yao, and Yiwei Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04876","last_updated":"2026-05-27T05:39:51Z","snapshot_observed_at":"2026-08-06T04:16:05.142007Z","submitted_at":"2026-01-08T12:21:09Z","title":"ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:56:08.058417Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2601.04876"},"observation_digest":"sha256:af8c91b069c7907d612eda439704d9557f3e3541b59288154bdaeb573d16983a","observation_id":"84f927ca-2991-4e01-859c-5bddd2c27880","resolution":{"observed_at":"2026-08-03T11:56:08.058417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-13T22:11:30.473038Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.19127","last_updated":"2026-06-30T17:07:30Z","snapshot_observed_at":"2026-08-14T08:08:00.293282Z","submitted_at":"2026-03-19T16:48:28Z","title":"On Optimizing Multimodal Jailbreaks for Spoken Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T22:11:30.473038Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2603.19127"},"observation_digest":"sha256:0d12f2cbf8b968584376ba476a8f06e5f0545c0499bfe124b32de35daf5938e6","observation_id":"3e1e3656-2c13-429e-a0a0-dbb558ce4d48","resolution":{"observed_at":"2026-07-13T22:11:30.473038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2605.17225","last_updated":"2026-05-17T02:13:58Z","snapshot_observed_at":"2026-08-15T22:57:05.041517Z","submitted_at":"2026-05-17T02:13:58Z","title":"Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T23:17:08.124240Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2605.17225"},"observation_digest":"sha256:8702e8a49f048a6dafd8babf979773ab6e4e5e2dedb4708fb91c2494ca110240","observation_id":"331b3224-b194-4b0d-9d77-e0a96c6b3ba4","resolution":{"observed_at":"2026-05-19T23:17:57.425254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2605.18168","last_updated":"2026-05-18T10:10:31Z","snapshot_observed_at":"2026-08-14T20:14:13.741727Z","submitted_at":"2026-05-18T10:10:31Z","title":"Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-20T09:48:43.319804Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2605.18168"},"observation_digest":"sha256:cb144326e451a90c09030ff26479ba03fa294dc7a4520dd690749207f4dd31d9","observation_id":"637a9c5e-df3b-4e98-a5ad-415e0865c6ba","resolution":{"observed_at":"2026-05-20T09:53:15.969331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-14T22:20:00.600867Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:bbb869951121b6ef939f73fbe35235fcf4f4906195999afdb9dd5e4899e3d7fa","observation_id":"52be56bc-4ee2-46cd-b658-70a0c890bf95","resolution":{"observed_at":"2026-05-21T07:39:48.840914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2606.10581","last_updated":"2026-06-09T08:45:52Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:45:52Z","title":"ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:05.518547Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2606.10581"},"observation_digest":"sha256:2a984b634fb982cd1de381600e00e07fb35805930bc006b437238c898b2a1723","observation_id":"dc537d9d-b741-4ec1-9695-aaa12fbc4006","resolution":{"observed_at":"2026-07-03T05:07:39.459073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-08-14T12:28:23.502257Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:cc188827d5dacce2fce7584f154c68f625dfb60e71b49cae9ab000d9557be9ad","observation_id":"13948d62-8a8e-4d9a-a12d-b2b46744b58b","resolution":{"observed_at":"2026-07-04T13:59:52.816236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15406/citation-record","integrity":"/paper/2505.15406/integrity","json":"/paper/2505.15406/citation-record.json","paper":"/paper/2505.15406"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:23:00.520353Z","title":"Gpt-4 technical report // arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.520353Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:c5c837d7aa3a3468514337638c177c9debc355e57533c92b64ef1f808b018faa","observation_id":"7598b741-b824-4372-a081-aa55a75e3ada","resolution":{"observed_at":"2026-08-07T15:23:00.520353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-13T14:30:59.825464Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-07T15:23:00.586445Z","title":"Audiolm: a language modeling approach to audio generation.(2022) // arXiv preprint arXiv:2209.03143","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.586445Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:a862770800f93498ca5593d701767a89944f9edd31b3d5084a71f3ea444bd06b","observation_id":"878317e2-89bc-4850-b524-fdd36535fa17","resolution":{"observed_at":"2026-08-07T15:23:00.586445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.753222Z","title":"Benchlmm: Benchmarking cross-style visual capability of large multimodal models // European Conference on Computer Vision","venue":null,"work_id":"23827700-0667-4c02-9055-90f9ab16397e","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.637202Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:9aa03370a410072b986b3cc149342a97a8172b4cf7e16119b8d3ea5adf785346","observation_id":"149ccc71-aab0-48e9-a4c3-b1047fe010c8","resolution":{"observed_at":"2026-08-07T15:23:06.813430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-07T15:23:00.686245Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models // arXiv preprint arXiv:2404.01318","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.686245Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:c36786d205bbf33d3b6195b20e0a9c084ea872156ee5e41e032b5dcb86a7697b","observation_id":"7cf5262a-a842-46bc-8240-26f4af2c54c2","resolution":{"observed_at":"2026-08-07T15:23:00.686245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-13T11:47:54.095263Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-07T15:23:00.732479Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages // arXiv preprint arXiv:2305.04160","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.732479Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:8fe4818bd975abd5ca6d38b11dba396e9adeb9888d827971c17376d0f35f4a11","observation_id":"b3046cd1-3de4-4f34-ada3-738dfcacd11d","resolution":{"observed_at":"2026-08-07T15:23:00.732479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.621296Z","title":"Unveiling the power of language models in chemical research question answering // Communications Chemistry","venue":null,"work_id":"97e830ec-26cd-4a53-96ec-c2c4fca21d7c","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.834983Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:a1c7b8e4f8f64fb5ff2ea353e19c980af0ef57ed1370523186d233e482c59c7d","observation_id":"403523a6-1fd5-48cb-bf77-2241df91c196","resolution":{"observed_at":"2026-08-07T15:23:06.667549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T15:23:00.899140Z","title":"Qwen2-audio technical report // arXiv preprint arXiv:2407.10759","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.899140Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:45066423e43d20c989aee2c7964fcac975dc32bb6f89668876ebfc9e8ad0e20e","observation_id":"7b87d514-3853-4a4a-8c59-a37e0dbd56f6","resolution":{"observed_at":"2026-08-07T15:23:00.899140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T15:23:00.937688Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models // arXiv preprint arXiv:2311.07919","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.937688Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:9dcc7d1bc774415d16547856f94e02466737fed1c1f9029914c6b2af788a24f3","observation_id":"49e1752a-0443-4a6d-af31-1f3d106648b0","resolution":{"observed_at":"2026-08-07T15:23:00.937688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.489870Z","title":"Pengi: An audio language model for audio tasks // Advances in Neural Information Processing Systems","venue":null,"work_id":"343576f4-426c-4c72-a651-425c3e902217","year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.976045Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e782b4b6bf98dd4c98300bd1ee029670d3e0855b8121c577982c66cf41de4fec","observation_id":"be766e0b-d2a5-47d3-9a86-af69fb2285a3","resolution":{"observed_at":"2026-08-07T15:23:06.558009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.384006Z","title":"The phase vocoder: A tutorial // Computer Music Journal","venue":null,"work_id":"087016d2-076c-440d-b358-5abca3133335","year":1986},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.020120Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:f0681826fdb8aa0df2cc2924291506076b1a7259c2a490e6535e7c8633840404","observation_id":"cf5be773-4c3b-4785-95e6-2a4cf23981db","resolution":{"observed_at":"2026-08-07T15:23:06.442005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.261778Z","title":"When does contrastive learning preserve adversarial robustness from pretraining to finetuning? // Advances in neural information processing systems","venue":null,"work_id":"2c1fd820-c58e-4f7b-91f1-d3e66742991a","year":2021},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.088155Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:52c16584b05c4409f7ade28b86f989dbdc9a56505aa764f63845d2f0cb978a37","observation_id":"28471991-f4b6-442c-ac2c-5bcd9650c886","resolution":{"observed_at":"2026-08-07T15:23:06.332081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-15T18:25:40.547533Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:23:01.147173Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models // arXiv preprint arXiv:2409.06666","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.147173Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e42c709c5f16531732631968be5c52c0a4181fa7523735a807acae80a904339e","observation_id":"dc9e1a5e-b5fa-4f82-8711-d91ee80fa622","resolution":{"observed_at":"2026-08-07T15:23:01.147173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.084118Z","title":"Prompting large language models with speech recognition abilities // ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"f06bc581-1916-42cc-8cbb-733d5a6cd646","year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.191660Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:20d1140a92d5fb06a3c46fd1840d3e68de3094b0d3bd85a6662e5f0e3835b811","observation_id":"68df4d41-e9eb-4ddd-bd5f-702551a6b126","resolution":{"observed_at":"2026-08-07T15:23:06.160143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02811","last_updated":"2018-07-08T13:06:26Z","snapshot_observed_at":"2026-08-13T17:25:53.968899Z","submitted_at":"2018-07-08T13:06:26Z","title":"A Tutorial on Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02811","snapshot_observed_at":"2026-08-07T15:23:01.286272Z","title":"A tutorial on Bayesian optimization // arXiv preprint arXiv:1807.02811","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.286272Z"},"links":{"cited_paper":"/paper/1807.02811","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:046625f264cd584af8fb9d3cf8b0f6955d7d2acd3e0480c74b7970a39723e61d","observation_id":"92d5cb71-f2f4-49f0-abf1-5cafde38f643","resolution":{"observed_at":"2026-08-07T15:23:01.286272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.973756Z","title":null,"venue":null,"work_id":"edabf62e-b883-4188-b8f8-48af2f6fa545","year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.363375Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:6706f0f9897dfc1ba97cf2519575631fe2f5e6f70e16ba3de86c60be03e24b33","observation_id":"fc54a43b-0412-4f6c-a823-2e555c397ae1","resolution":{"observed_at":"2026-08-07T15:23:06.030619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-08-14T17:26:37.664745Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-08-07T15:23:01.399521Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models // arXiv preprint arXiv:2412.17034","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.399521Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:8ecb7dbb7bc4fd450eff89d7c55a185b6a0e2c7441a9e7bbe5605fd0771f57d6","observation_id":"b83560eb-6c72-4f8f-bc06-60b13f5dd309","resolution":{"observed_at":"2026-08-07T15:23:01.399521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-14T05:38:29.247632Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T15:23:01.440392Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities // arXiv preprint arXiv:2406.11768","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.440392Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:4b8b38fa4b73c4f970cde625e48d18a82b3f7a0509e7addf262f321e89df21d9","observation_id":"7736233f-1a62-4215-91ab-9ca5f3ef4338","resolution":{"observed_at":"2026-08-07T15:23:01.440392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-13T11:39:40.594833Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T15:23:01.487032Z","title":"Listen, think, and understand // arXiv preprint arXiv:2305.10790","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.487032Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:08dd94f8abe20430dd9a0059cb6281703ac50060dc225d1de86c1ae255554ffa","observation_id":"1bcd468c-9691-4cef-ad2d-f78d419acf2b","resolution":{"observed_at":"2026-08-07T15:23:01.487032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13458","last_updated":"2024-10-17T11:38:54Z","snapshot_observed_at":"2026-08-12T22:21:03.596074Z","submitted_at":"2024-10-17T11:38:54Z","title":"MedINST: Meta Dataset of Biomedical Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13458","snapshot_observed_at":"2026-08-07T15:23:01.588714Z","title":"MedINST: Meta Dataset of Biomedical Instructions // arXiv preprint arXiv:2410.13458","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.588714Z"},"links":{"cited_paper":"/paper/2410.13458","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:986a7344d3f1a489e44cd03924a3a166690bfdc64c6a5d8f44c1a3be93cd6d61","observation_id":"7a5b2b43-06b5-4a4f-84c0-c711f0c589b4","resolution":{"observed_at":"2026-08-07T15:23:01.588714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-15T19:08:03.118831Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T15:23:01.636740Z","title":"Distilling an end-to-end voice assistant without instruction training data // arXiv preprint arXiv:2410.02678","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.636740Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:08c836208cf6ff2581425baa8255afc5ee3c74991bbdc916adf99a6ee49fd0c5","observation_id":"e9bebd05-8fbe-4d53-b74d-843f9e9c173f","resolution":{"observed_at":"2026-08-07T15:23:01.636740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14296","last_updated":"2026-05-15T15:43:44Z","snapshot_observed_at":"2026-08-15T05:15:04.246228Z","submitted_at":"2025-02-20T06:20:36Z","title":"On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14296","snapshot_observed_at":"2026-08-07T15:23:01.681691Z","title":"On the trustworthiness of generative foundation models: Guideline, assessment, and perspective // arXiv preprint arXiv:2502.14296","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.681691Z"},"links":{"cited_paper":"/paper/2502.14296","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ebd9a8d88d84ec19333edefc99c746d93bed38ea40d227f0b2faa2e940f1ad0a","observation_id":"d85f12f6-46a1-4b49-9b75-10a68e8d8692","resolution":{"observed_at":"2026-08-07T15:23:01.681691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:01.726140Z","title":"Breaking Focus: Contextual Distraction Curse in Large Language Models // arXiv preprint arXiv:2502.01609","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.726140Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:0d642951d2dc91d8d089761c1c2c13bdef38ae31bc4acf0193cbdbf276ff943a","observation_id":"deab6ffb-3312-4d70-9c79-307d167e06cc","resolution":{"observed_at":"2026-08-07T15:23:01.726140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03556","last_updated":"2024-12-19T22:37:45Z","snapshot_observed_at":"2026-08-14T18:59:07.584753Z","submitted_at":"2024-12-04T18:51:32Z","title":"Best-of-N Jailbreaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03556","snapshot_observed_at":"2026-08-07T15:23:01.792126Z","title":"Best-of-n jailbreaking // arXiv preprint arXiv:2412.03556","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.792126Z"},"links":{"cited_paper":"/paper/2412.03556","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:051c1a7b656418a8501b1fba34995beef7ed39b6a301ac0be5c1f931bd16a88a","observation_id":"2eb2895a-8b70-4ba9-a4b1-72f283573b16","resolution":{"observed_at":"2026-08-07T15:23:01.792126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08608","last_updated":"2024-12-11T18:30:57Z","snapshot_observed_at":"2026-08-14T19:26:19.827983Z","submitted_at":"2024-12-11T18:30:57Z","title":"AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08608","snapshot_observed_at":"2026-08-07T15:23:01.879152Z","title":"AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models // arXiv preprint arXiv:2412.08608","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.879152Z"},"links":{"cited_paper":"/paper/2412.08608","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:548e74dbb7fddf963ff738395603a1b6a6f1e059d3bddd39065bd156f6cc4a0a","observation_id":"597f482d-0e88-42a5-94ce-f8a28a0ec0f2","resolution":{"observed_at":"2026-08-07T15:23:01.879152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.806884Z","title":"On generative spoken language modeling from raw audio // Transactions of the Association for Computational Linguistics","venue":null,"work_id":"883314a6-84b4-4618-acd1-97a25b15fdbf","year":2021},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.925562Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:16d07e888c2117317474ec5e8d7b0e3c41892ead22616030245bd4507c2f56e2","observation_id":"0de53495-e92f-43d3-a20c-922b0e3ce738","resolution":{"observed_at":"2026-08-07T15:23:05.860628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:01.968676Z","title":"Appagent v2: Advanced agent for flexible mobile interactions // arXiv preprint arXiv:2408.11824","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.968676Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:8ebb48557dfead459f2b67cbee3bdcfd9aff6caf3b98580b1e07cff542c65150","observation_id":"364709af-c496-489e-a38a-8bb2476330c3","resolution":{"observed_at":"2026-08-07T15:23:01.968676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01552","last_updated":"2023-12-04T00:46:11Z","snapshot_observed_at":"2026-08-14T18:19:44.102991Z","submitted_at":"2023-12-04T00:46:11Z","title":"The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01552","snapshot_observed_at":"2026-08-07T15:23:02.007476Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning // arXiv preprint arXiv:2312.01552","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.007476Z"},"links":{"cited_paper":"/paper/2312.01552","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e85a25fbd28b037123870a6cfd6ccaa252fee46a5c3cf76a13d7b9c7f0fb5890","observation_id":"081e9339-f6f7-42ea-9357-433d651db1c7","resolution":{"observed_at":"2026-08-07T15:23:02.007476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:23:02.108648Z","title":"Deepseek-v3 technical report // arXiv preprint arXiv:2412.19437","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.108648Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:9a2e73277b4115c04d354b1b74e6a47ba2253b19f4c0d0b9199b4077704fb7a3","observation_id":"e80b5488-f604-4a6e-9bf8-64e24c0699db","resolution":{"observed_at":"2026-08-07T15:23:02.108648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19064","last_updated":"2025-05-28T08:26:32Z","snapshot_observed_at":"2026-08-12T22:15:37.957597Z","submitted_at":"2024-10-24T18:17:16Z","title":"The Stepwise Deception: Simulating the Evolution from True News to Fake News with LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19064","snapshot_observed_at":"2026-08-07T15:23:02.176423Z","title":"From a tiny slip to a giant leap: An llm-based simulation for fake news evolution // arXiv preprint arXiv:2410.19064","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.176423Z"},"links":{"cited_paper":"/paper/2410.19064","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:05ff5923c2f7cdfa9622f76311aecbe1023513e374f86920bcb7d29b6ad9d045","observation_id":"744829b7-db84-4717-ae27-c546e16a6251","resolution":{"observed_at":"2026-08-07T15:23:02.176423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.618405Z","title":"Semi-Supervised Audio Classification with Consistency-Based Regularization","venue":null,"work_id":"491581f0-2cdc-4787-a39e-e8f14b71b259","year":2019},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.217670Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:fa7596deb6d85f480b586e53ea55bde7ce502fc0b2ddcc71e3cfb9c8d7311c1f","observation_id":"9b5bae6b-6cc0-442f-9763-014445911a9e","resolution":{"observed_at":"2026-08-07T15:23:05.711665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-08-14T05:18:40.171816Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T15:23:02.306051Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM // arXiv preprint arXiv:2305.15255","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.306051Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:c0597102092e0ba9f266976a492115efb469df2605a14013c5dd967d29af9296","observation_id":"ca56d13a-6ae1-47f2-8bb2-cbfae82600fe","resolution":{"observed_at":"2026-08-07T15:23:02.306051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.418075Z","title":"GPT-4o System Card","venue":null,"work_id":"6e17c83c-e4d9-4f91-950a-057e8f6698de","year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.385978Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ac3bb634f2a131f80684d097b55376d409cba412526a19d7ed51b3b9a0488c01","observation_id":"9bf90d67-6483-4171-9319-5c844864419e","resolution":{"observed_at":"2026-08-07T15:23:05.493281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.228544Z","title":"Robust speech recognition via large-scale weak supervision // International conference on machine learning","venue":null,"work_id":"ed6568c6-a026-4b96-99b2-b5a3355cbf54","year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.427147Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:8bef5efa171f306f888f63ae44ce884095be5b642b3e79fad68d595e366f6314","observation_id":"c6f8883c-a238-4374-a738-f4a48ca2e6ee","resolution":{"observed_at":"2026-08-07T15:23:05.293333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:23:02.488545Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context // arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.488545Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:22c85dbc202b8c9c883027d953b5d2e577a495dde769939a506d6aaee94e770f","observation_id":"b15cb1dd-8681-4a9b-9144-e7b62a26388e","resolution":{"observed_at":"2026-08-07T15:23:02.488545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T15:23:02.574675Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks // arXiv preprint arXiv:1908.10084","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.574675Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:1e662dc246762a444a187a022c0ca62e7526c3a879c44dec3f7d715dadbb70d5","observation_id":"685266cb-e724-4002-aa77-91c78b6438ee","resolution":{"observed_at":"2026-08-07T15:23:02.574675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-08-15T09:51:02.522141Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-07T15:23:02.652356Z","title":"do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.652356Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:b05cee9c777e4111c769b26690cae7c24ef1c439bb846de18f9f37cb4b4b50dd","observation_id":"07f45772-dcd5-4b4f-b063-9b2910745024","resolution":{"observed_at":"2026-08-07T15:23:02.652356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19103","last_updated":"2024-05-29T14:07:44Z","snapshot_observed_at":"2026-08-15T06:43:08.487035Z","submitted_at":"2024-05-29T14:07:44Z","title":"Voice Jailbreak Attacks Against GPT-4o","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19103","snapshot_observed_at":"2026-08-07T15:23:02.718736Z","title":"Voice Jailbreak Attacks Against GPT-4o // arXiv preprint arXiv:2405.19103","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.718736Z"},"links":{"cited_paper":"/paper/2405.19103","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:6c054cb06bed0e5b1b7d0d7b9b00c65492f87d55156c6742aa6bc18542b129bb","observation_id":"70fada26-c9f2-497b-be8e-ad7fecc34ae4","resolution":{"observed_at":"2026-08-07T15:23:02.718736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18074","last_updated":"2025-03-23T13:04:57Z","snapshot_observed_at":"2026-08-13T00:20:12.177046Z","submitted_at":"2024-04-28T05:33:15Z","title":"MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18074","snapshot_observed_at":"2026-08-07T15:23:02.806149Z","title":"Mmac-copilot: Multi-modal agent collaboration operating system copilot // arXiv preprint arXiv:2404.18074","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.806149Z"},"links":{"cited_paper":"/paper/2404.18074","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:656dfbd78462290948a35a288554c81c7c07e409c094b87b5f3027047d4a28d5","observation_id":"2bbd188d-7258-4011-9421-be4bef6806dd","resolution":{"observed_at":"2026-08-07T15:23:02.806149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00781","last_updated":"2024-10-16T19:29:14Z","snapshot_observed_at":"2026-08-12T22:21:32.841957Z","submitted_at":"2024-10-16T19:29:14Z","title":"Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00781","snapshot_observed_at":"2026-08-07T15:23:02.864812Z","title":"Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies // arXiv preprint arXiv:2411.00781","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.864812Z"},"links":{"cited_paper":"/paper/2411.00781","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:639e4746db85ba48e140c652b9ab32de3bf0da73df4e4a8dbcc8e7052db0aafc","observation_id":"aa19044d-0fb0-4ca3-b729-09d96db6621a","resolution":{"observed_at":"2026-08-07T15:23:02.864812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10708","last_updated":"2025-08-30T11:17:17Z","snapshot_observed_at":"2026-08-15T00:51:29.401277Z","submitted_at":"2025-02-15T07:43:43Z","title":"Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10708","snapshot_observed_at":"2026-08-07T15:23:02.924153Z","title":"Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey // arXiv preprint arXiv:2502.10708","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.924153Z"},"links":{"cited_paper":"/paper/2502.10708","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e303ba0fcb744327286b9cce6566aea609522becc71171788aaa32142e2d5242","observation_id":"72687450-45bb-4fad-819c-71493aae0c64","resolution":{"observed_at":"2026-08-07T15:23:02.924153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:03.023360Z","title":"Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework // arXiv preprint arXiv:2502.13759","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.023360Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:5f2f6c874a47fda169174b1fe93465648457e411a1eab854563483dbb801820b","observation_id":"a940e22c-b5cf-4a0c-8454-71bab046d0e9","resolution":{"observed_at":"2026-08-07T15:23:03.023360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-14T17:40:31.626392Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-07T15:23:03.080825Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs // arXiv preprint arXiv:2407.04051","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.080825Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:2ec3283c34c19c82c61943e0e1c704f0ef445a00406a804895cde1b20db60797","observation_id":"c7aa87d2-76f0-434a-bbbf-bd1f5efc4938","resolution":{"observed_at":"2026-08-07T15:23:03.080825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.093080Z","title":"Uncertainty-aware audiovisual activity recognition using deep bayesian variational inference // Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"1dcff80b-7dc8-4bda-ae7f-3fc3064964e5","year":2019},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.151665Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:606bc0339a4d7fc9c20038866fbeeae74e7cb5a056a89910b058749b2c05236e","observation_id":"e79854be-f6b5-4ec1-b729-de796a11c984","resolution":{"observed_at":"2026-08-07T15:23:05.176210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-07T15:23:03.204970Z","title":"Salmonn: Towards generic hearing abilities for large language models // arXiv preprint arXiv:2310.13289","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.204970Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:c9dd6f49a72ff947fb94037372faa97b444af4a1592725642b9061c138e2ca24","observation_id":"9ee6abce-ebcb-4242-83c9-4d258b3341c5","resolution":{"observed_at":"2026-08-07T15:23:03.204970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01714","last_updated":"2025-03-03T16:31:45Z","snapshot_observed_at":"2026-08-07T17:33:08.982744Z","submitted_at":"2025-03-03T16:31:45Z","title":"Word Form Matters: LLMs' Semantic Reconstruction under Typoglycemia","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01714","snapshot_observed_at":"2026-08-07T15:23:03.261377Z","title":"Word Form Matters: LLMs' Semantic Reconstruction under Typoglycemia // arXiv preprint arXiv:2503.01714","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.261377Z"},"links":{"cited_paper":"/paper/2503.01714","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:fb54d1965e5f8f0c7fe7a5edbf5e85e33181fa0c7cb87b52ce2d1cbd88f25f77","observation_id":"3d668558-ce22-46b3-8aa0-da12d6dc8533","resolution":{"observed_at":"2026-08-07T15:23:03.261377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-14T22:08:37.138719Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T15:23:03.314763Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation // arXiv preprint arXiv:2305.16107","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.314763Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:29cf4c02502da73a0b75982c4f0c8667490f24b4ae239895089c69ee4ab9c18f","observation_id":"4f65ed92-a07d-4eba-b903-d475e502c3ad","resolution":{"observed_at":"2026-08-07T15:23:03.314763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:04.985859Z","title":null,"venue":null,"work_id":"2796f45f-0f52-4a51-b4cf-7902dc0288e7","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.372586Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d9de41e8b3eeae507f2122e38db65e9bbec75aa98d84f00f533744db2651be77","observation_id":"1929dd54-4ffb-41f3-8da3-c6abc5681a79","resolution":{"observed_at":"2026-08-07T15:23:05.034694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11127","last_updated":"2026-05-31T18:23:52Z","snapshot_observed_at":"2026-08-13T11:57:57.181602Z","submitted_at":"2023-04-21T17:02:38Z","title":"Tree-Structured Parzen Estimator: Understanding Its Algorithm Components and Their Roles for Better Empirical Performance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11127","snapshot_observed_at":"2026-08-07T15:23:03.437115Z","title":"Tree-structured parzen estimator: Understanding its algorithm components and their roles for better empirical performance // arXiv preprint arXiv:2304.11127","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.437115Z"},"links":{"cited_paper":"/paper/2304.11127","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:7ca816f5041abbe74256407f8794462f805cf3ffe6e7d0a655f453357c34146f","observation_id":"eb6fa4e2-26a0-45e8-97e8-974bf38c77fb","resolution":{"observed_at":"2026-08-07T15:23:03.437115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:04.854702Z","title":"On decoder-only architecture for speech-to-text and large language model integration // 2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)","venue":null,"work_id":"b0e84d2e-7521-4d5b-b118-da14b720e9d1","year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.497543Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d5a144b6c6e1915f22a7ae868194ba61c7aa0107db903456b95ee5f389654e14","observation_id":"cab37f51-1b86-434f-9f0c-d6261bc06c5d","resolution":{"observed_at":"2026-08-07T15:23:04.914786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-14T02:26:17.829525Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T15:23:03.563984Z","title":"Next-gpt: Any-to-any multimodal llm // arXiv preprint arXiv:2309.05519","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.563984Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:9eb82818c12b1bde44f9763c4aecdde73c0df8f1b54814a1e3deba2cba810750","observation_id":"489727a3-afcd-4908-9d9c-f9f8f5e0b8df","resolution":{"observed_at":"2026-08-07T15:23:03.563984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:03.611324Z","title":"Tune In, Act Up: Exploring the Impact of Audio Modality-Specific Edits on Large Audio Language Models in Jailbreak // arXiv preprint arXiv:2501.13772","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.611324Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:00b935467c67038b7621f2ae969a24b2aa12be9c6a255309ed97c46c4b6934db","observation_id":"7715cdcd-02e7-4453-8ff8-6f024434de7c","resolution":{"observed_at":"2026-08-07T15:23:03.611324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:04.738624Z","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","venue":null,"work_id":"565833ac-e0e1-46eb-a52a-f87abe34793f","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.684965Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:40d7e69468119b3bd2b377b3beab7e7bd1a3e8ec0985c203aef8cbcce9810584","observation_id":"5b6bc949-bb67-4e16-ae07-5c37c9392648","resolution":{"observed_at":"2026-08-07T15:23:04.785627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-15T15:02:34.870602Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T15:23:03.760260Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming // arXiv preprint arXiv:2408.16725","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.760260Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:5750a74f8509a1a3f6a8f9570102dd5a8171d187c5c970e0cb9f3bd252a32f93","observation_id":"ac45c727-7552-4005-bf59-aa94ff80e20f","resolution":{"observed_at":"2026-08-07T15:23:03.760260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23861","last_updated":"2024-10-31T12:11:17Z","snapshot_observed_at":"2026-08-12T22:10:54.793287Z","submitted_at":"2024-10-31T12:11:17Z","title":"Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23861","snapshot_observed_at":"2026-08-07T15:23:03.832495Z","title":"Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models // arXiv preprint arXiv:2410.23861","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.832495Z"},"links":{"cited_paper":"/paper/2410.23861","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:a3e0d4ad6e9d7034519e79c36da2f820c9598e570c58e04c0c204e62d444619a","observation_id":"2c8a081b-e87f-4448-8d6b-83e182e5bd67","resolution":{"observed_at":"2026-08-07T15:23:03.832495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06302","last_updated":"2024-07-03T00:51:21Z","snapshot_observed_at":"2026-08-15T04:13:31.869882Z","submitted_at":"2024-06-10T14:18:56Z","title":"Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06302","snapshot_observed_at":"2026-08-07T15:23:03.879687Z","title":"Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks // arXiv preprint arXiv:2406.06302","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.879687Z"},"links":{"cited_paper":"/paper/2406.06302","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:11882c79ce74842d8af57e4f4226c372a66052317d9580ed358624877e6b9a1b","observation_id":"bf0da2a0-4557-45b0-87f0-095555012f49","resolution":{"observed_at":"2026-08-07T15:23:03.879687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-13T11:39:26.737742Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T15:23:03.939492Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities // arXiv preprint arXiv:2305.11000","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.939492Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:4ffa1b9267e91b051557e4704b20446d9a4f2dfdfd855bed7117beb769aa4dc7","observation_id":"3779bbc0-9a67-4738-bbb6-19f27823bcf2","resolution":{"observed_at":"2026-08-07T15:23:03.939492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T15:23:04.010212Z","title":"Universal and transferable adversarial attacks on aligned language models // arXiv preprint arXiv:2307.15043","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:04.010212Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:3af1fb23f9593591a289bfd4c9a9fdc985f118c9926431ac2ba4e3465b740aec","observation_id":"b46e04f3-5895-4420-9e00-c87e2cbd00e0","resolution":{"observed_at":"2026-08-07T15:23:04.010212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 9 inbound Pith citation observations for arXiv:2505.15406."}