{"as_of":"2026-08-15T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76ca3c116343abef4a1d1a49bc043e13f8d215dfc049e1062fcc3c2239fcb740","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:53:50.291447Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:53.614645Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:01:24.303798Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14842","snapshot_observed_at":"2026-08-07T04:08:53.614645Z","title":"arXiv preprint arXiv:2411.14842 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11521","last_updated":"2025-06-13T07:22:36Z","snapshot_observed_at":"2026-08-14T07:45:07.248965Z","submitted_at":"2025-06-13T07:22:36Z","title":"Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-08-07T04:08:53.614645Z"},"links":{"cited_paper":"/paper/2411.14842","citing_paper":"/paper/2506.11521"},"observation_digest":"sha256:c14190b470012b50c4555f74e6d7c4835799ad2b9a5bc78a9213c9477b672eda","observation_id":"5fc71e28-71a2-4d99-8525-194bb4fceb9a","resolution":{"observed_at":"2026-08-07T04:08:53.614645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2411.14842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14842","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Who can withstand chat-audio attacks? an evaluation benchmark for large language models","venue":null,"work_id":"ea0b654c-7d41-4666-8d38-645409da8879","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2411.14842","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:a92526d7d350bbd943971761096fc5722d7077223a802af613b1074279cff3ba","observation_id":"7cf92bd0-5ea8-4629-95ae-e39e65d899e1","resolution":{"observed_at":"2026-05-18T13:01:24.305685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14842/citation-record","integrity":"/paper/2411.14842/integrity","json":"/paper/2411.14842/citation-record.json","paper":"/paper/2411.14842"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.181090Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.181090Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b0c6d182091a9b2da2f3ea7ea0889789317d4280daa5df36b25b2625a2d8244a","observation_id":"ba5d5b06-610e-45d7-b0b0-45b07683fe57","resolution":{"observed_at":"2026-08-12T14:53:50.181090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.184464Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.184464Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:928cb1916dee0e5a261642e9a278c9ef2593b5c1eb08516fa6ca3a675c0ae253","observation_id":"10b626ae-cc60-4653-99b9-08db4fc775d5","resolution":{"observed_at":"2026-08-12T14:53:50.184464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.559691Z","title":"https://mindgard.ai/resources/audio-based-jailbreak-attacks-on-multi-modal-llms?hs_amp=true Audio-based jailbreak attacks on multi-modal llms","venue":null,"work_id":"46a4cc68-69cd-4129-a9bb-b391d13d1b82","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.187536Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:ea0a2d042158929d887977fbf33e94b0fe0acfb26b2143bb8fb2228c193d2fa6","observation_id":"03958182-a0ae-4e07-9242-fe66ca3dda32","resolution":{"observed_at":"2026-08-12T14:53:50.562562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:53:50.190254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.190254Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:5e13f6f75ad7a85f0817536f5d4711ca15bb581814642e5666b98a967b4756ca","observation_id":"648746cc-f3a7-46ef-b7e1-a66bf1f98a50","resolution":{"observed_at":"2026-08-12T14:53:50.190254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T14:53:50.193004Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.193004Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:5a37739d3ce8745c1c862d21dde0c457ebe137b106e1f1c37e129fbe4cb213fb","observation_id":"cc86c316-5d8f-44fe-a60a-5e5e3d4e7047","resolution":{"observed_at":"2026-08-12T14:53:50.193004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-13T14:30:59.825464Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-12T14:53:50.195710Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.195710Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:a5ce4b92f47ac68daa77678df4c9351a59b043700d32b633dd810ea75f34ed48","observation_id":"37f13612-8d29-464a-83c4-2f0d060d96c6","resolution":{"observed_at":"2026-08-12T14:53:50.195710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.552436Z","title":null,"venue":null,"work_id":"546b0e80-5f5e-45dd-8157-41613a88fe75","year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.198493Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:6e456f213c7744ceba7a3da5270b6262da3f1c767ff849aac96dc3831e815639","observation_id":"96eff583-1f1d-48ee-b94c-d9ee0a3e4208","resolution":{"observed_at":"2026-08-12T14:53:50.555001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-13T11:47:54.095263Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-12T14:53:50.200951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.200951Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:73a300b7c6c21419cec4b844fa6fb20181ddecb0b9a7746e56b6d0724968e4e9","observation_id":"fcf0152e-b1f2-4192-95ba-797a2a41b387","resolution":{"observed_at":"2026-08-12T14:53:50.200951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-12T14:53:50.203848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.203848Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:87e9adc7716577cb288a21e4b7c40efdef718903b137b5b8568e5abf859e6020","observation_id":"d0cc565e-8671-4409-8d88-c0eef7461e5c","resolution":{"observed_at":"2026-08-12T14:53:50.203848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-12T22:47:34.452271Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T14:53:50.206384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.206384Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:d66793e8af7c458a00bd9065aa7e5d40fa6ff714bee3b3b84191c1e4b2e7429a","observation_id":"b9dd0ca6-42d6-4fdf-8f04-b1419870419b","resolution":{"observed_at":"2026-08-12T14:53:50.206384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.209199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.209199Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:5076dc1d687b334ea9cbdec4e3b572e244fc26cba7d5d150cce06c6199de0bfd","observation_id":"627023ff-a988-4368-a316-a63aa45e0422","resolution":{"observed_at":"2026-08-12T14:53:50.209199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03280","last_updated":"2019-01-11T06:57:33Z","snapshot_observed_at":"2026-08-14T20:15:24.831311Z","submitted_at":"2017-11-09T07:41:53Z","title":"Crafting Adversarial Examples For Speech Paralinguistics Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03280","snapshot_observed_at":"2026-08-12T14:53:50.211503Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.211503Z"},"links":{"cited_paper":"/paper/1711.03280","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:acfbbc1734ca2c201f42d48d757aa52c355ee820cd902f050e4fd6009da2dd43","observation_id":"486790f9-0b5a-40f8-afbc-20ba81c3b34b","resolution":{"observed_at":"2026-08-12T14:53:50.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-12T17:13:46.394331Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-12T14:53:50.214015Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.214015Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:a63f1354d5f645ef30a8bff3fd89e4b90037b784df5350d8ae05c23ef7a635df","observation_id":"a7406b9c-ca49-476d-83c2-231ae9e05159","resolution":{"observed_at":"2026-08-12T14:53:50.214015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.216630Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.216630Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b4a5cc3c28c9f8a9b13cd9542dea6c5991200857515ba515150700e68d7c6253","observation_id":"477936b0-7483-4144-a6dc-0903cd6b9dd3","resolution":{"observed_at":"2026-08-12T14:53:50.216630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.537027Z","title":null,"venue":null,"work_id":"d96fcd87-f99e-48f6-8333-a1331828baa1","year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.218844Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:81fe59972f127915051f06423fbbb96665655b24a8b0cf49c32b96880ff0e3e9","observation_id":"bc1c7d80-3e03-47e2-815f-e82673e8cd43","resolution":{"observed_at":"2026-08-12T14:53:50.539989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.529034Z","title":null,"venue":null,"work_id":"a9feb79c-67d2-480f-82cc-83ced91e7cc6","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.221167Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:4bb2da6c1445581c9a1b5cad8288831762516e196f4eeeb2436fccfca7a4cf4e","observation_id":"42422993-fcd3-4c08-b84e-3dd72e361457","resolution":{"observed_at":"2026-08-12T14:53:50.531981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.223514Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.223514Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:28df8ffdaf80c81beade4df1aa3b3b34db8720822f4cab8555cd4d4ad02359c0","observation_id":"222b03e1-8048-4644-bdb2-827943b144b8","resolution":{"observed_at":"2026-08-12T14:53:50.223514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14642","last_updated":"2021-07-30T14:07:49Z","snapshot_observed_at":"2026-08-13T04:47:28.309742Z","submitted_at":"2021-07-30T14:07:49Z","title":"Practical Attacks on Voice Spoofing Countermeasures","version":1},"cited_work":{"arxiv_id":"2107.14642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.14642","snapshot_observed_at":"2026-08-12T14:53:50.373411Z","title":"Practical Attacks on Voice Spoofing Countermeasures","venue":"cs.CR","work_id":"c3f09c97-b4ab-4715-abc1-11a36fe19dce","year":2021},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.225865Z"},"links":{"cited_paper":"/paper/2107.14642","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:e59b0df7b2a53de703f24054df41a99665faa9d9c29ab8b993a518862f07152a","observation_id":"60bab187-7eec-47aa-bbee-82ed448c3745","resolution":{"observed_at":"2026-08-12T14:53:50.378095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.516885Z","title":null,"venue":null,"work_id":"01300c39-d24f-4191-97b1-72e6b8e5a8a4","year":2015},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.228627Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:9d6053eedb31215079943542c9c1170fa8016f1b6c5ed03d56d47fbc28a1a772","observation_id":"11b5b3a4-84e1-4dd1-b689-04f7dd265e23","resolution":{"observed_at":"2026-08-12T14:53:50.519528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.509644Z","title":null,"venue":null,"work_id":"f0caca51-33d6-4bd7-b64d-2570f5974cf8","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.230799Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:cf48d258dc273e07bb60caa23d4741a3b11fbecf58a5902797fb9a17840347b1","observation_id":"7795793c-73df-4ed6-80c1-8a583cd36271","resolution":{"observed_at":"2026-08-12T14:53:50.512298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.233179Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.233179Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2f62964bc7d9ce5f355d98d555b2c9aa6b18b7e3b116b367750ed250ebd55bae","observation_id":"e0bb5fff-4783-4c6e-a3a4-eda8094b08b7","resolution":{"observed_at":"2026-08-12T14:53:50.233179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.235548Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.235548Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:d4cedcff5241c05f9801adc7e251dd77b45723e8b38d8173dc6317f77f439cb5","observation_id":"43218a79-3d53-46e9-8701-1f2bce8624e5","resolution":{"observed_at":"2026-08-12T14:53:50.235548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.237798Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.237798Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:8c39d173f50aac76abef078ff224211e1080dc9e9a75f532e4668cda45d2540c","observation_id":"38bf092c-26d5-4826-bb45-b7eb49dcc8c1","resolution":{"observed_at":"2026-08-12T14:53:50.237798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-08-14T18:32:30.931998Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-12T14:53:50.240142Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.240142Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:8fe202015d0fe48a0904f585a3ac22f4f15a0c5242a13cecd1bb0031cd8e8968","observation_id":"f25f35c9-0600-405d-854c-58c93ff06b6e","resolution":{"observed_at":"2026-08-12T14:53:50.240142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09984","last_updated":"2020-10-02T03:08:04Z","snapshot_observed_at":"2026-08-14T14:55:04.375361Z","submitted_at":"2020-04-21T13:30:02Z","title":"BERT-ATTACK: Adversarial Attack Against BERT Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09984","snapshot_observed_at":"2026-08-12T14:53:50.242789Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.242789Z"},"links":{"cited_paper":"/paper/2004.09984","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b2507909e19d290373116c93578aa6f9bc65ec1af53b6c23acc402f09f4fb416","observation_id":"3d40e55a-6c83-4881-bc8c-648778f03a46","resolution":{"observed_at":"2026-08-12T14:53:50.242789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.245376Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.245376Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:8b0f2adb19558f54f3748c1673cd33d9969aadc2825bc13b8ff778523ce725e2","observation_id":"bd491c59-430d-4cb9-acc9-46c016f2f114","resolution":{"observed_at":"2026-08-12T14:53:50.245376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.487649Z","title":null,"venue":null,"work_id":"1f460773-c4cb-4439-bc17-f671ff9a791b","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.247705Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:df94db872325e7bd4f4db2a6f6030f6839197cf92eb094e9b1e985b2b2612ce3","observation_id":"dfa25e81-5557-42c7-b925-8def239575c5","resolution":{"observed_at":"2026-08-12T14:53:50.490297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03828","last_updated":"2019-08-15T05:15:43Z","snapshot_observed_at":"2026-08-14T16:34:40.697673Z","submitted_at":"2019-05-09T19:35:30Z","title":"Universal Adversarial Perturbations for Speech Recognition Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03828","snapshot_observed_at":"2026-08-12T14:53:50.250123Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.250123Z"},"links":{"cited_paper":"/paper/1905.03828","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:bd0073c06ea4d6550f366fffcecbcc0005d58acaa339d824beeae51a7fbc49b5","observation_id":"f2dfba72-681a-42a7-9238-80a840cd5757","resolution":{"observed_at":"2026-08-12T14:53:50.250123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.480360Z","title":null,"venue":null,"work_id":"2cd31441-19df-4736-a91e-bb683804f56b","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.252728Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2cc559ef376766bc6351fa24f70a629b85e77e98417f88b40e5b7931f9239cc6","observation_id":"b11c9d48-3d80-42e9-93a1-58213be636e4","resolution":{"observed_at":"2026-08-12T14:53:50.482953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-14T18:19:10.821318Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-12T14:53:50.255144Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.255144Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:1f5037c24e69fe2f165e4bebe92a402bde27ea1f44fe1a50d5265542ceff0515","observation_id":"f9366436-e76f-4f1f-8760-ae3355f798c9","resolution":{"observed_at":"2026-08-12T14:53:50.255144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.257739Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.257739Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:009ec2002141ffc4ad1efd46e6fb93630cf21827a37b2821c224eedf558d754f","observation_id":"d719191c-745e-40de-9674-334d7756c878","resolution":{"observed_at":"2026-08-12T14:53:50.257739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T14:53:50.260054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.260054Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:943f5c34d07ed6dff98bdb6646f530e752d75b43bf7fb5cc9e91f11e9b236961","observation_id":"e29aff72-4f58-4383-a4eb-300dc7d3922f","resolution":{"observed_at":"2026-08-12T14:53:50.260054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.262421Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.262421Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b39b030809e2fbd45710778aaf5558b848c9506ce3b5c00915fd434d269ef859","observation_id":"28da6201-a48e-4fca-b5d3-aa3929698ff2","resolution":{"observed_at":"2026-08-12T14:53:50.262421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-08-15T06:11:28.424821Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-12T14:53:50.264719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.264719Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:1fe65a16c62a3645121d9e70b7cd3e6bd838a60361207e5c9390fe3c89d957a0","observation_id":"6563df85-7341-406a-860c-5133be0ec1cd","resolution":{"observed_at":"2026-08-12T14:53:50.264719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.465055Z","title":null,"venue":null,"work_id":"dfc1c64d-fbb5-468f-af09-094fd5f2f857","year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.267548Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:80f17d6cb5f324d81cf0c2d943327a624ca8fba62b2740d1641a2181a1392989","observation_id":"0d80c757-b79b-4f3a-80e6-be0e7c0472e9","resolution":{"observed_at":"2026-08-12T14:53:50.467619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-08-15T16:41:15.505782Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-12T14:53:50.269950Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.269950Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:bf908adf0f22e2562a064cd64bab47c15250ce3f443a2f47cfc8847dddade5d6","observation_id":"eb30e7a8-8cb1-4b0d-aebd-af82e3ce047a","resolution":{"observed_at":"2026-08-12T14:53:50.269950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-12T14:53:50.272249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.272249Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:c6e33753e0de2e9fcb76ebb6acb40b2663db7ba4cadb2d5823073fb304b2e77c","observation_id":"8e68ac8a-b0bc-4e98-8101-4533f3045b4e","resolution":{"observed_at":"2026-08-12T14:53:50.272249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.457811Z","title":null,"venue":null,"work_id":"1f919539-2a2a-4274-b4e6-b5382b3d35a7","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.274792Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:8a159a6b5dece2e6444901a01bd487ff23a620bba75e582f11a5c87022e4b468","observation_id":"34cbb73a-4218-4fa6-bdb3-3f9828aa8201","resolution":{"observed_at":"2026-08-12T14:53:50.460451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-14T17:23:13.764826Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-12T14:53:50.277008Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.277008Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:9b5b5755a89616d48b8481412055045c28cb753d26bef877a5437fbe099c4f4b","observation_id":"9973a1e1-1a7e-4873-b5cd-f824c26b7f68","resolution":{"observed_at":"2026-08-12T14:53:50.277008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.279212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.279212Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:a3081bc682ca747ef9927654d0460c4f7b5e30a78846ddbf8fbda2e47854fd1d","observation_id":"dcf30d46-b378-44b1-b844-e9e79cd55611","resolution":{"observed_at":"2026-08-12T14:53:50.279212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.446570Z","title":null,"venue":null,"work_id":"e67662ff-9f75-43c0-b4ac-93adc6951e72","year":2021},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.281571Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:f47349cfaadac0adb9156c6a43a3c37b8cf1175fa1eb459fbf78344e5290692e","observation_id":"2845429d-25e5-4aa7-a5da-d30a9c8155a6","resolution":{"observed_at":"2026-08-12T14:53:50.449323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.439222Z","title":null,"venue":null,"work_id":"343058c0-120a-426b-96e3-43f7f1a29121","year":2020},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.284062Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:725d52f64bf63620005f8b963f8118b665439f72a8f573de17148e89a83210ea","observation_id":"24ad5ad3-8b5a-4d78-804e-b78ca199ed99","resolution":{"observed_at":"2026-08-12T14:53:50.441791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-13T11:39:26.737742Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-12T14:53:50.286582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.286582Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:c420983d49309bfbd420e8f98906c14eb38976d710ef9e33db14406e12c804f9","observation_id":"a6fc6891-7878-449c-ad9a-34aa68a21cc8","resolution":{"observed_at":"2026-08-12T14:53:50.286582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.431891Z","title":null,"venue":null,"work_id":"451910d5-2dcb-4104-a2ee-aae7d63df564","year":2022},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.289070Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b0e302a73976c63225fea30b78694a775d76e57f601ee3706e5ab41fab1522a0","observation_id":"4dc5f1dd-5a8f-4ef7-ad56-ec30331b9091","resolution":{"observed_at":"2026-08-12T14:53:50.434539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.291447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.291447Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:f687f0589ee3d83b85c011f18a157bc9af298ec219658409c4ee97f58516c329","observation_id":"39a28f5e-ad5d-4226-9991-0e9a31096deb","resolution":{"observed_at":"2026-08-12T14:53:50.291447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T11:32:07.976086Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2411.14842."}