{"as_of":"2026-08-11T08:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42818a0790449e24d4b869c5dee8afb4985796d8bc7c9d5b38ff68b875cf29ae","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:22:34.997009Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:52:45.801592Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:52.874154Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-08-05T09:03:01.095551Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:230a937bb88e00df723d1193bd47795b3b3d8236c490dde98c760a1b9faed830","observation_id":"438bb6eb-afa4-4118-9e01-f38ceee8c266","resolution":{"observed_at":"2026-05-18T18:11:43.185900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-08-03T11:52:45.801592Z","title":"Christoph Leiter, Yuki M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04946","last_updated":"2026-06-01T13:55:11Z","snapshot_observed_at":"2026-08-09T12:03:17.550557Z","submitted_at":"2026-01-08T13:49:14Z","title":"Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:52:45.801592Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2601.04946"},"observation_digest":"sha256:8b9cd9ce5ad21c3b7aff98b69babc9d348e95c0a592211aba8c32103ef8d80e6","observation_id":"420de55c-2f6c-49e9-9414-845e6f2c69af","resolution":{"observed_at":"2026-08-03T11:52:45.801592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-08-03T09:21:31.131370Z","title":"International Phonetic Association","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2601.14046","last_updated":"2026-07-13T00:34:38Z","snapshot_observed_at":"2026-08-09T06:47:16.244200Z","submitted_at":"2026-01-20T15:00:36Z","title":"PRiSM: Benchmarking Phone Realization in Speech Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T09:21:31.131370Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2601.14046"},"observation_digest":"sha256:ed1167ba86e2ea73f257159f80c7be259992f3f381aa5d4075d51049ccdc934a","observation_id":"b118258d-1bab-4c12-ba6a-d91a2b208abd","resolution":{"observed_at":"2026-08-03T09:21:31.131370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2604.14548","last_updated":"2026-04-20T07:51:45Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:24:59Z","title":"VoxSafeBench: Not Just What Is Said, but Who, How, and Where","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T10:19:28.041282Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2604.14548"},"observation_digest":"sha256:69f9451994f1a5497dd62c6f56ff7b5f9e643c8f1d1a77ad78f15e23dc6c484d","observation_id":"3af163d3-1a39-4b7a-8f15-d33576402f1d","resolution":{"observed_at":"2026-05-10T10:24:22.088783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2604.17248","last_updated":"2026-07-03T19:14:23Z","snapshot_observed_at":"2026-08-04T09:23:59.836631Z","submitted_at":"2026-04-19T04:22:47Z","title":"VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:50.923340Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2604.17248"},"observation_digest":"sha256:7d4028d2423d56ecd1aeee2dfea761e7c0e1c0afc357447cc3886bfd6f92452d","observation_id":"a2e3a273-2a73-4c70-9492-e80937080f18","resolution":{"observed_at":"2026-05-10T05:51:10.226416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.01597","last_updated":"2026-05-02T20:11:12Z","snapshot_observed_at":"2026-08-11T02:48:21.767517Z","submitted_at":"2026-05-02T20:11:12Z","title":"Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI","version":1},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-05-08T19:27:18.774649Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.01597"},"observation_digest":"sha256:fec7ab191006a6466b1cae2d193c00175a06c328452e598aaf98a3065ba56f99","observation_id":"c7a02f6c-211f-4b94-ba6b-cd699f7bcfc5","resolution":{"observed_at":"2026-05-09T05:55:29.197360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-11T08:40:42.838855Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:46c45db38b59237c8aad5f79b06b11edc89c5665559be651796e882c553b3ac8","observation_id":"ec1072ce-d1cb-4a1e-97ae-f072a79f6845","resolution":{"observed_at":"2026-05-15T01:53:28.861492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2605.17225","last_updated":"2026-05-17T02:13:58Z","snapshot_observed_at":"2026-08-07T09:09:04.903896Z","submitted_at":"2026-05-17T02:13:58Z","title":"Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T23:17:08.124240Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2605.17225"},"observation_digest":"sha256:f07c30b068fe62c6b64bceabe5dd0ec1b42beb6dca2346a6e4f8cf57897f0ecd","observation_id":"6e1dc822-8c61-4464-b2ea-73165ac7f0a0","resolution":{"observed_at":"2026-05-19T23:17:57.430007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2508.21376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-07-04T13:59:52.874154Z","title":"arXiv preprint arXiv:2508.21376 , year=","venue":null,"work_id":"a56c2721-5ed0-4324-8477-082878ecad65","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:b9b7ba0f1e0525f4fb224721fdc3f3d5cae5c764d241bd495932b084337f0417","observation_id":"0a7d2131-ece3-4fec-9428-112d78267f36","resolution":{"observed_at":"2026-07-04T13:59:52.875641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21376","snapshot_observed_at":"2026-08-02T00:57:37.780637Z","title":"AHELM: A holistic evaluation of audio-language models.arXiv preprint arXiv:2508.21376, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14846","last_updated":"2026-07-16T11:15:16Z","snapshot_observed_at":"2026-08-09T14:09:05.849030Z","submitted_at":"2026-07-16T11:15:16Z","title":"RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:57:37.780637Z"},"links":{"cited_paper":"/paper/2508.21376","citing_paper":"/paper/2607.14846"},"observation_digest":"sha256:2d6c076a36e368cefc3f4da2b96adfb9561d6cb272c7f71648181746044dad18","observation_id":"6d5d8abb-cfc8-46d0-a5f4-cc38b5f97d4c","resolution":{"observed_at":"2026-08-02T00:57:37.780637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21376/citation-record","integrity":"/paper/2508.21376/integrity","json":"/paper/2508.21376/citation-record.json","paper":"/paper/2508.21376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T14:22:33.697071Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.697071Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1f39e4dbbb190996cde2c100bee335bdaf2493cf0cca7c5eec63dd645c356072","observation_id":"c9781f1e-d579-44da-aab7-1f362649c634","resolution":{"observed_at":"2026-08-05T14:22:33.697071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.736245Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku, 2024","venue":null,"work_id":"0f96a7b0-16e8-4dbf-83ef-822c8a35f8bf","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.778200Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:94b9ec87c71fc1e8f905d97329f155d246fb08902a691e4629ddfd5c1e38bca2","observation_id":"51e0b0aa-3846-40c3-8ef3-af0dd4b33398","resolution":{"observed_at":"2026-08-05T14:22:35.739040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-05T14:22:33.923565Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:33.923565Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:528f465c21c45bf5e3cf7f74ea9e87ff84a4b144e79ab072f0e2252053d46b1b","observation_id":"a2426604-3b6c-4168-a590-8cb736b79234","resolution":{"observed_at":"2026-08-05T14:22:33.923565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T14:22:34.102234Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.102234Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:4e961324df5eed0d723030854ac6de7a7c51af32f132a7b0601920e39340801b","observation_id":"2602b30f-96dd-4597-8e93-c1a7b37ea665","resolution":{"observed_at":"2026-08-05T14:22:34.102234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.728097Z","title":"Towards multimodal sarcasm detection (an _obviously_ perfect paper)","venue":null,"work_id":"6b7db93e-f137-4868-bd4a-dbd23fb7c8ed","year":2019},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.243183Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:c4a181e5aa47288f90650ae81a8152d6d8680a4a3f3bf497814484e710a41bdb","observation_id":"6b69d948-705f-4460-9ef4-0a4967a3ff44","resolution":{"observed_at":"2026-08-05T14:22:35.731229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T14:22:34.352067Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.352067Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5a211dc322d553b4c6287afcd73168387ca53b6d5092bf2b3694b06d1d3f946f","observation_id":"2b74c9ce-de68-4f7c-b1c5-70410f7cdd73","resolution":{"observed_at":"2026-08-05T14:22:34.352067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-05T14:22:34.385152Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.385152Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:c2b9245ee860328f65f58127c7f745d1588fc6d3e14beb56cb14677eb60c1fd8","observation_id":"41cacf6c-12bb-4b8c-a526-e4abebb8b96f","resolution":{"observed_at":"2026-08-05T14:22:34.385152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.720080Z","title":"Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit","venue":null,"work_id":"1a0310c2-c209-496b-8354-0873585053ec","year":1968},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.540549Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:fcf2b0c5392e1e3ada802d47f4840b34db7c521987be7563fe36d560b9514c92","observation_id":"e4269de4-646a-4529-86dc-f4865d5969a2","resolution":{"observed_at":"2026-08-05T14:22:35.722887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.711808Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech","venue":null,"work_id":"388b3435-c5f8-4028-b5da-a72816644e9e","year":2022},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.635896Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:7b58188fcede7db93fb9a39c9da5fe0b8755d1bca19b0f7f6e85810698a3edcf","observation_id":"38f7207c-cba3-4f5a-9765-493bc4c10f6b","resolution":{"observed_at":"2026-08-05T14:22:35.714660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05060","last_updated":"2024-06-27T16:05:35Z","snapshot_observed_at":"2026-08-07T01:31:01.707015Z","submitted_at":"2024-01-10T10:37:45Z","title":"MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector","version":2},"cited_work":{"arxiv_id":"2401.05060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.05060","snapshot_observed_at":"2026-08-05T14:22:35.195342Z","title":"MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector","venue":"cs.SD","work_id":"ce3e001b-5ce9-4df8-8bb7-1bbb8da26565","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.753589Z"},"links":{"cited_paper":"/paper/2401.05060","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d293016beb07f64208d45cd9818f6c21539dcb25053af750ece2ea65b295af12","observation_id":"c7aecf5c-9e8e-491b-8fa9-a0115a3c3be6","resolution":{"observed_at":"2026-08-05T14:22:35.199235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.703018Z","title":"Speech-transformer: a no-recurrence sequence-to- sequence model for speech recognition","venue":null,"work_id":"ad6b49d4-332c-46c6-9641-ac6ee679b4d5","year":2018},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.775890Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:856f3fdd39a1ab15c4b4c5fe9846d1a4f6e80415b4667d32b529922554d5a422","observation_id":"d728dde4-d52a-4a2f-b473-9ccde920fbd1","resolution":{"observed_at":"2026-08-05T14:22:35.706024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T14:22:34.779733Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.779733Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:55c44005e23711bcaaf14f583df5c9a4ae983fa226d125612590357b98f4dd1b","observation_id":"fe123ce9-b696-4805-9234-726bc74cbbe1","resolution":{"observed_at":"2026-08-05T14:22:34.779733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.694578Z","title":"Alpacafarm: A simulation framework for methods that learn from human feedback","venue":null,"work_id":"c9d4d5ff-08ab-4231-bfb4-97910ccf817b","year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.783925Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:8eb8577bf1ef6a0a6eb1bf591135e85527b322f05b5865306d751cfa9c79e6d4","observation_id":"9a8d9c12-d1d7-4781-8e23-3bd439c1ee47","resolution":{"observed_at":"2026-08-05T14:22:35.697626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.686000Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"9b1dd061-48ed-401a-8f71-ef2720efcbd4","year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.787398Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1f22c8e80f344a824c467c01f6a78edde2c787c551e9fcf4e1e1d2821ec45897","observation_id":"02a1fa96-c5ad-42d8-b7c0-252adacb5815","resolution":{"observed_at":"2026-08-05T14:22:35.689202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05779","last_updated":"2024-02-08T16:11:23Z","snapshot_observed_at":"2026-08-06T17:26:13.649575Z","submitted_at":"2024-02-08T16:11:23Z","title":"Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images","version":1},"cited_work":{"arxiv_id":"2402.05779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05779","snapshot_observed_at":"2026-08-05T14:22:35.164290Z","title":"Examining Gender and Racial Bias in Large Vision-Language Models Using a Novel Dataset of Parallel Images","venue":"cs.CY","work_id":"c49cc320-4b01-4bdb-b759-367b6b4d9222","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.790680Z"},"links":{"cited_paper":"/paper/2402.05779","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5ebf5e6bab32cd6f03c891e307996edc9e6e05cfa6a1f79c187855edfb198aa2","observation_id":"6b2cf18e-ff38-4505-a3d2-fc3396052351","resolution":{"observed_at":"2026-08-05T14:22:35.170240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.677541Z","title":"CSR-I (WSJ0) Complete","venue":null,"work_id":"ec19b6bd-402f-4485-be1e-283e87488f9e","year":2007},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.794039Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b90f747ba12fbb52979edd71631c44874d27040b66a5bdb52534b3dd530171ce","observation_id":"dd5a1352-ec15-4aed-98d6-51d73912d090","resolution":{"observed_at":"2026-08-05T14:22:35.680312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T14:22:34.797552Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.797552Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:53a37bab7e400725f5165fd0395637e023d24a304d17d7ae0c944e5a131139d0","observation_id":"a2cebc79-52ca-4f7e-bb5c-7b9e40df3c96","resolution":{"observed_at":"2026-08-05T14:22:34.797552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.666809Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":"adfd9987-662e-47f6-9bb4-6e343157306d","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.801817Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3107b774f3c0238306a75f5f36869b748dbac2cf2d1b6625283398bf9985d053","observation_id":"80c80121-1169-4858-a503-2b0fc6c46247","resolution":{"observed_at":"2026-08-05T14:22:35.669917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.658592Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition","venue":null,"work_id":"99b912fe-549a-4671-8ee6-1338667be76e","year":2022},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.805468Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:04553b2fab5e5c37271a76b5f415731aa040099d39dbadcae5750b6f8d4dcc67","observation_id":"0afda4f7-ceff-44f8-9dc6-e6014bebf7d0","resolution":{"observed_at":"2026-08-05T14:22:35.661754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-10T08:23:44.451766Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T14:22:34.808889Z","title":"Sequence transduction with recurrent neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.808889Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:01889927fe375789645b649683f29a073c7ef5fff70faaad10685886548b2a67","observation_id":"93ad2fea-62ad-447d-84c6-01898825071b","resolution":{"observed_at":"2026-08-05T14:22:34.808889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.650451Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":"2bccc166-2455-4418-8845-5e89e89e2491","year":2006},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.812080Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:6ddb028de40bd2ff281437201a274f90974e966b8151d964b3b5c4d060dd5944","observation_id":"71697c35-c355-43ba-b779-faeba1af1613","resolution":{"observed_at":"2026-08-05T14:22:35.653539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:22:34.815275Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.815275Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3c566ecc8883382e2bbf76255b8ac9cea417c8aca347540844a3272e50755b9b","observation_id":"6641787a-fc0b-4f71-8245-0d829f09500b","resolution":{"observed_at":"2026-08-05T14:22:34.815275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.641883Z","title":"Design of a linguistic statistical decoder for the recognition of continuous speech","venue":null,"work_id":"976449da-3806-4bc5-a62b-e3308e8acdb3","year":1975},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.818670Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:fb88cf35b82faf5a6a922ade221b8c57bc5abcb788da7ae0b95505ffe987877c","observation_id":"9668280e-98e8-4b15-88ba-4a84c824c22c","resolution":{"observed_at":"2026-08-05T14:22:35.645260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.633809Z","title":"Gemini 2.5: Our most intelligent AI model","venue":null,"work_id":"cb0b763f-e490-485e-a4ce-a36059ddc1f2","year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.821970Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:ce01190d40c57506323963c5267739b882e62d7276e3c3230e1c10ce889c0100","observation_id":"366e1f1f-8735-45f1-bd81-92a809687cb2","resolution":{"observed_at":"2026-08-05T14:22:35.636480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.626089Z","title":"AudioCaps: Generat- ing captions for audios in the wild","venue":null,"work_id":"6db7259c-778e-47dc-9234-261b556aab7a","year":2019},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.825065Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d879cd12b88f526db20339b5591e3de5b3931797fbe09507dd5cf61e975607ec","observation_id":"13b680d9-4fd5-4b52-95f4-db89ba74f8ea","resolution":{"observed_at":"2026-08-05T14:22:35.628926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.617627Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":"695270cb-cc83-4a51-b6f9-5c356aec7b62","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.828327Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:64f94e0b66162ac01a7431c1f955de1c4f1b5d3aa67c8540295eb94fbb85b13d","observation_id":"106c11c1-51a3-405e-9cb2-fed3cd7d70fc","resolution":{"observed_at":"2026-08-05T14:22:35.620586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.607683Z","title":"Vhelm: A holistic evaluation of vision language models","venue":null,"work_id":"dd75ef9d-d659-4dee-9e11-610089145bc0","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.832092Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:c178347db8c7a0323365c3968b72398e808f3854123d300e9fbab28ea5e24d59","observation_id":"7d73ef13-c850-4071-8564-9fe6da7cf9b3","resolution":{"observed_at":"2026-08-05T14:22:35.611540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.598010Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"b8056bc5-7251-495d-8b56-a87768e0dd2c","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.835355Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:2b92c2e3c972c35e40d86fb15b88ff817a76904b4bf69fa10526e97dff4aa476","observation_id":"e85f6957-3677-45d6-8bd4-bf9d69372f0f","resolution":{"observed_at":"2026-08-05T14:22:35.601221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.588701Z","title":null,"venue":null,"work_id":"7f5aeb43-1103-4fa6-a8c9-047a69a655d8","year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.838505Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:dc79deb582f6ca3ce7caa8a7d3afbe95a2a817c39afe2ae45bcdc53b0bb3f92d","observation_id":"779edca4-f6cc-4ca8-a1b6-cf978c979b3e","resolution":{"observed_at":"2026-08-05T14:22:35.591876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.578987Z","title":"The next chapter of the Gemini era for developers","venue":null,"work_id":"4ea7d429-55a7-49dc-8a31-b7f230522bcb","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.842252Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:6f93bd04524fe8b3c0eb7f2c6c7ca0e021227821712a44e134877b282ff27651","observation_id":"e0df2478-580a-4889-a915-2f06b3634273","resolution":{"observed_at":"2026-08-05T14:22:35.582196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.569820Z","title":"Hello GPT-4o, 2024","venue":null,"work_id":"7924f257-5204-4acb-b328-3e659bfad862","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.845109Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:23a373046c16b8d3c9e3274a3578f8be20571297b7017cd0485d5e81972b0d2e","observation_id":"280baaad-fbf2-4893-88cf-f56237ef9faa","resolution":{"observed_at":"2026-08-05T14:22:35.572830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.559334Z","title":"Introducing our next-generation audio models, Mar 2025","venue":null,"work_id":"145e5065-ccdf-42d4-ae7c-dda663ad5dd8","year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.848693Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3132aee3a8fff8e295b448f325c10b0e1fb6f98e3d84c0ef8181ba4a5ee37bf8","observation_id":"0ed65fc5-1a08-49c4-95dc-657b8e8cfabb","resolution":{"observed_at":"2026-08-05T14:22:35.563178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.550611Z","title":"LibriSpeech: an ASR corpus based on public domain audio books","venue":null,"work_id":"96a1ef6b-a09c-4dd8-b7b9-44e57f571f64","year":2015},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.851608Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:8f48be18608b941df503522556b4e606bfda83f96a052c270f5daaaf7ae4f546","observation_id":"1d37ba2b-6924-4f40-bb80-fbaad1e10bbf","resolution":{"observed_at":"2026-08-05T14:22:35.553483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.542148Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversa- tions","venue":null,"work_id":"85cf8e3c-c191-46c0-81a4-f78fb3914074","year":2019},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.855344Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:316ae5e01e2b55a371d375f3fee95d5de2132643424ac37bfdadf9b05da3f9cc","observation_id":"0a627daf-dfb1-40e9-82a3-149fe1217b18","resolution":{"observed_at":"2026-08-05T14:22:35.545031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-05T14:22:34.858777Z","title":"Mls: A large-scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.858777Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:70e31b8224d8ec724376b4ea40d1174a5fc53c70c4441788dd64437b3ac6d3ac","observation_id":"4a345e82-50e5-47fb-8f4e-f8f82df64bad","resolution":{"observed_at":"2026-08-05T14:22:34.858777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:34.862427Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.862427Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:54b32b28f231db05cf0c38688b3feb17fbd8b55cf0a1bc4dbe71972902f13eaf","observation_id":"0c9017b8-63ac-46df-81f9-2c5038f0525e","resolution":{"observed_at":"2026-08-05T14:22:34.862427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07937","last_updated":"2024-12-09T13:43:15Z","snapshot_observed_at":"2026-08-09T19:40:20.289856Z","submitted_at":"2024-03-08T08:10:29Z","title":"Speech Robust Bench: A Robustness Benchmark For Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07937","snapshot_observed_at":"2026-08-05T14:22:34.865850Z","title":"Speech robust bench: a robustness benchmark for speech recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.865850Z"},"links":{"cited_paper":"/paper/2403.07937","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:8e07b941b5a305d93f65c05408c30aef8386d4be69d0b8db476653ce2e6c6dce","observation_id":"20219ee9-5565-425d-80c8-3895efb66f6e","resolution":{"observed_at":"2026-08-05T14:22:34.865850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.527015Z","title":"V oice jailbreak attacks against GPT-4o, 2024","venue":null,"work_id":"6d0e500b-ac09-4302-b385-fe206cb0e917","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.869568Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:5906d21ed826ffa9945541b1702132dc0dd099fe83216130b3acdd690e533198","observation_id":"90cb00ee-5387-4568-af70-1a4c4781ecf3","resolution":{"observed_at":"2026-08-05T14:22:35.530681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.517985Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":"904c7206-f8a4-4133-a43e-5007716e2e40","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.872720Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:01e101d27c2ab405a9b4f8356231ed928a23b0b42b7963babd6c316a43126053","observation_id":"09d16adf-5107-46f1-bb0e-e5f9d8bf2d42","resolution":{"observed_at":"2026-08-05T14:22:35.521493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T14:22:34.875777Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.875777Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b58a605c30aa4cd5e622489f314e326cfe1ebe5ed18053ed6583f4e73a1070a2","observation_id":"4e4f081b-e1f0-4e0c-887e-5c4cd491836a","resolution":{"observed_at":"2026-08-05T14:22:34.875777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-09T21:19:30.065131Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-05T14:22:34.879225Z","title":"CoV oST 2 and massively multilingual speech-to-text translation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.879225Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:9cb39b8b39193fa8a0186ba8ef30140dbc40c719ea870aa4ddcefcf2d3205b5a","observation_id":"3abc1829-0a24-4cb6-bc49-48c29cb16690","resolution":{"observed_at":"2026-08-05T14:22:34.879225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T14:22:34.882641Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.882641Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3e71a6fa37a93037af641b616501f1114fc86a58d9c44c616a2b103675029783","observation_id":"b57f1fcb-69fa-49dc-8cfe-fa202f93dd4e","resolution":{"observed_at":"2026-08-05T14:22:34.882641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T14:22:34.886194Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.886194Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:28f2f82a9609c1af09e65d677607016983bf1579ceb77946d059abf993f160bb","observation_id":"81ee07bf-d9ee-44bb-b7c7-8ea7ded00799","resolution":{"observed_at":"2026-08-05T14:22:34.886194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-06T03:59:19.956442Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-05T14:22:34.889693Z","title":"AIR-Bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.889693Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:ae01489f309f87596a06972f04110ebb47648408c4e3a020445ccbfa69a86c63","observation_id":"d1b45dbc-f6be-4405-871f-4538421e4457","resolution":{"observed_at":"2026-08-05T14:22:34.889693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.509334Z","title":"Speechlm: Enhanced speech pre-training with unpaired textual data","venue":null,"work_id":"a3436166-df6f-4b7a-af97-39cc7ffbb3e6","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.893240Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:9f67897f2fd8c43dd3d818a50b9972617b674ccae21d2abd6a27243dc2ecc966","observation_id":"4d5afb4d-7645-48d4-86bc-306b24464242","resolution":{"observed_at":"2026-08-05T14:22:35.512709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.10752","last_updated":"2018-06-04T07:46:02Z","snapshot_observed_at":"2026-07-06T06:35:57.913552Z","submitted_at":"2018-04-28T06:54:11Z","title":"Syllable-Based Sequence-to-Sequence Speech Recognition with the Transformer in Mandarin Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.10752","snapshot_observed_at":"2026-08-05T14:22:34.896569Z","title":"6-12\" #Children","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.896569Z"},"links":{"cited_paper":"/paper/1804.10752","citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:78c33cb25808a904f04c4a49e2d56f9467d03e63eb639f64dac8e88de384b686","observation_id":"e4df7286-3747-4109-a699-fcaec0306b8a","resolution":{"observed_at":"2026-08-05T14:22:34.896569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.500960Z","title":null,"venue":null,"work_id":"e4040159-2c1f-47b1-982e-c3ddd29de38e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.901477Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:2e2e27aab4da468bda3d804d637300d95a088dd5847d70ccc7a442ae8f7a619a","observation_id":"f46aaaf8-49d0-4b7f-9471-8852c1804a6d","resolution":{"observed_at":"2026-08-05T14:22:35.503933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.492648Z","title":null,"venue":null,"work_id":"b60f790e-ea32-4e58-89f7-66945a961a8a","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.905490Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3c58e48d8e34cf7c92b8eefd25a980b8279eadd284712e0a697aed7d02d8d90b","observation_id":"6b02af22-b3d2-4244-a430-85bf59d46073","resolution":{"observed_at":"2026-08-05T14:22:35.495380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.484415Z","title":"humorous and imaginative","venue":null,"work_id":"372b396e-69de-474e-be9c-75dabd41c19a","year":2082},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.908871Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3fecc9aa4c94f0b9ee35fe1afb241a0548862cefc9aaa8f792f28220acf8f357","observation_id":"94f55932-df50-4f9f-ae84-315f1317d399","resolution":{"observed_at":"2026-08-05T14:22:35.487336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.476279Z","title":null,"venue":null,"work_id":"67781ce1-7fd7-45bb-8f36-1d38b76b0514","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.912676Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:de3434688abd1e5fec125b51fd83d4c58efa056b9c92eda38dff3c3b408caa78","observation_id":"9122540e-17ca-44f8-9f7d-e72828c7eedb","resolution":{"observed_at":"2026-08-05T14:22:35.478978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.467566Z","title":null,"venue":null,"work_id":"302a0062-28a7-4403-bd6e-f6385a1f4251","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.916173Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:2c2ea95ab88bfa26b6282922289fc02aa7da4be19511500d9e43512efacdf944","observation_id":"36bc4d4e-83e2-4d0e-bf9d-0e3c89ed6915","resolution":{"observed_at":"2026-08-05T14:22:35.470623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.458189Z","title":"E.1.1 Obtaining a list of contrasting roles We use the list of roles from PAIRS (replicated in Table A4) to seed the generation of speech content","venue":null,"work_id":"a9190f09-ff40-44f5-a633-f8de6d5d5dca","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.919399Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:fc5a9bc717138138002217e1a819a70a205411520ba4c7b655bd0ae17261ae51","observation_id":"746c16fa-8b67-4ab6-8ddd-f90736f57628","resolution":{"observed_at":"2026-08-05T14:22:35.461880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.450053Z","title":null,"venue":null,"work_id":"bce3fece-1494-4bab-aaa4-bee930c36f9d","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.922630Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:e146c4fd882c09d7715e75c1ca8b6e4f8d1b7952572468b25a1c82d2672cc531","observation_id":"1953059c-e1a3-4b3a-9680-cad11029ab8e","resolution":{"observed_at":"2026-08-05T14:22:35.452859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.442252Z","title":"You should refer to the score rubric","venue":null,"work_id":"06a07d50-cbc1-4b66-8d9b-5529782164e0","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.926181Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:1ec14414a66685be3bfd40184b63407acec9596b1d770cc176c200d8f7b4239f","observation_id":"7100bcb0-534f-44b1-853f-e0a1fb4429cb","resolution":{"observed_at":"2026-08-05T14:22:35.445050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.434730Z","title":null,"venue":null,"work_id":"71646057-6049-4a84-8ff2-7d6dbaa76254","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.929628Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:b268239c745c5c65a2266eb3659175bb541372d6c2ead9cbf3fb99466ecb4881","observation_id":"91bc551c-76b9-45aa-bc4f-37b5f5d10b12","resolution":{"observed_at":"2026-08-05T14:22:35.437420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.426503Z","title":"haha”) or throat clearing (e.g., “ahem","venue":null,"work_id":"969c9d66-8a74-44f5-97a5-730049f0da89","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.933794Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d28ec196fd50a4aeb16db2181ff15cffe36b334b59ef38f45770c460c2d96882","observation_id":"fd9eec2a-1908-42c0-81cc-67730c0c68d4","resolution":{"observed_at":"2026-08-05T14:22:35.429327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.418739Z","title":null,"venue":null,"work_id":"dec939a0-cf95-47a7-bfaa-45bf165a87d0","year":2024},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.937749Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:57c1be4045540a85b4674e953898dd2de3d4a33b47c7b1abd4571bf4ec1c45b1","observation_id":"cafd4911-0adb-4276-8e8d-1cd50d4a9aeb","resolution":{"observed_at":"2026-08-05T14:22:35.421481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.410501Z","title":"From Table A9, we see that Qwen2-Audio Instruct takes the lead in audio knowledge, followed by Gemini 2.5 Pro (05-06 Preview) and then Gemini 2.0 Flash","venue":null,"work_id":"27024e6e-a014-4be3-bcfa-c4728b8dc6f1","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.940870Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:273ca330ec297231cf18f2aee4364654fedaa163edff2a653c39943d43455873","observation_id":"d000f3ec-6c48-4317-99a0-4a1f55975eaf","resolution":{"observed_at":"2026-08-05T14:22:35.413407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.401996Z","title":"When looking at the safety aspect, we see that OpenAI models are robust to the voice jailbreak attack","venue":null,"work_id":"08c8b61a-6b3d-42f5-a5d5-3cf5a3f1a0d4","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.944391Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:24022f8c3da19cb8e17fd4b0022c270c9cb950699e4dedbcbd2e0b17ca26e31b","observation_id":"0ad1c622-00ad-4d0f-be3a-b2dc963f88b7","resolution":{"observed_at":"2026-08-05T14:22:35.404930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.393772Z","title":"We explain our benchmark in Section 3 and describe the experiments in Section 4 and report results in Section 5","venue":null,"work_id":"e34ffc41-0e17-4e22-8123-1d13af06911e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.947659Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3be57e046fa9092681badaa6e8ac7195becb7e155c779653b429fb6ee479e1e3","observation_id":"ce0143f0-edec-44b0-a2c5-f3104c8eec86","resolution":{"observed_at":"2026-08-05T14:22:35.396940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.384845Z","title":"Limitations","venue":null,"work_id":"98d11b80-da25-41b4-8fe7-8c61b315a57c","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.950813Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:fe7f9b191cb0816c68768af0f7bab9c952c428460e0b831a9144ec9ff278be31","observation_id":"fe1d0241-7fb1-4404-878f-8d5d953d958a","resolution":{"observed_at":"2026-08-05T14:22:35.388203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.376436Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"56d609bb-4521-428f-9144-248213af90c7","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.954108Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d6e6a986fa7284fdcf313a1d48e5bdb5b881fa7fa60d4907ff64e6455dfcf82c","observation_id":"94467b2d-8bef-4025-b527-944ac890cf07","resolution":{"observed_at":"2026-08-05T14:22:35.379320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.368377Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"cafbb3c5-ae9e-42b9-8c74-0fc2ff017a5e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.957811Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d1561b820f5f151cc3714b2892bec52c61cb75f642ba53f81b0d4d1c0de7ea24","observation_id":"865d1775-6ed3-449e-a803-01997f63b213","resolution":{"observed_at":"2026-08-05T14:22:35.371248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.359448Z","title":"com/stanford-crfm/helm and the new datasets at https://huggingface.co/ datasets/UCSC-VLAA/PARADE_audio and https://huggingface.co/datasets/ stanford-crfm/CoReBench_v1","venue":null,"work_id":"0806a528-4da6-4534-952f-b6995809dd4f","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.961310Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:9f69b6d7f3ac2da909fb83ce0db1db8119f4913ccb9a56f3964a3e775d7aa136","observation_id":"bed55278-f3a2-4c5b-942a-36e402193d8b","resolution":{"observed_at":"2026-08-05T14:22:35.362856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.350765Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"c5ccc09f-9903-498c-b585-e568d3becf77","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.964523Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:eaeaf640a1a9f55e448be497b1b5a95aa830a4520007e3096cd7510ef3dd7196","observation_id":"31b3c5a6-d911-4336-a6d4-ab1b7ac171cd","resolution":{"observed_at":"2026-08-05T14:22:35.354147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.341776Z","title":"But we do not compute error bars for other scenarios","venue":null,"work_id":"9c31f242-f5cb-4e0c-a708-992bfdb011cb","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.967592Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:f1713085eef3f9219107916478fdb3a08efea20deb6a814a7ad334e184ae7084","observation_id":"c9c61ba0-91ae-45a4-bcfd-6cd5a60f4db5","resolution":{"observed_at":"2026-08-05T14:22:35.344723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.332843Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"b31130c9-4e78-44ee-b77e-da5b013b3a3e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.970937Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:06a903f8c6692d9f9d61fad04d6206266d89e0c93ba9a2f7a47a10a7cda20768","observation_id":"2b1cd651-9153-45be-a311-d04b174b3f1d","resolution":{"observed_at":"2026-08-05T14:22:35.335836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.324609Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"e21c6d72-99b1-450b-b217-cef40d642cc6","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.974113Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:4377737931ec193005f3ebdf277d12597ae79ed18d0ac6ecca8c84cf44972eec","observation_id":"0ba18208-7e04-4b5c-8bd6-64e4f23efcec","resolution":{"observed_at":"2026-08-05T14:22:35.327529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.315133Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"97737f7b-5efa-4766-a7ab-d06c9a968ecd","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.977488Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:e333ab500a8daad1382a064405414e76c30302fe50c0ced89d12733ae28fc57a","observation_id":"1aacc2fa-b354-4c1b-82a3-e84f0db5faf4","resolution":{"observed_at":"2026-08-05T14:22:35.318849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.306167Z","title":"Before transforming tran- scripts to audio, we performed human scrutiny of the audio transcripts to make sure that there is no improper or toxic content in the metadata","venue":null,"work_id":"f03b44d8-4af8-47b9-9ca1-4ffe763afef0","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.980801Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:7c07289331e0449975a91d2f73e9c913596c2715ae25204703d8035e76013ed3","observation_id":"462c6a8a-0ff0-46e1-ae74-e02ca8c24b93","resolution":{"observed_at":"2026-08-05T14:22:35.309287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.296962Z","title":"We cite all the datasets and models used in our work","venue":null,"work_id":"e0abafa8-7be6-42ab-8a15-2f549ec06789","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.983943Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:a96569e8104b519914426e72cce41b52e13c11c0decee3ace559476f958428f0","observation_id":"979de6e4-0d9a-433a-8dfa-f1b0852bb2da","resolution":{"observed_at":"2026-08-05T14:22:35.300092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.286804Z","title":"PARADE is available at https://huggingface.co/datasets/UCSC-VLAA/PARADE_ audio","venue":null,"work_id":"27f32d48-2406-490c-a59d-dffa9dd463c3","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.987392Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:bc7c4efa127399991912fc80850798ee90f4bec97a860114a983e07a557c2123","observation_id":"e119bfdd-abc9-4fae-92af-603f17650782","resolution":{"observed_at":"2026-08-05T14:22:35.289975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.276410Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"80b409af-f5a4-40c9-9394-3002461a0d5e","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.990404Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:4a05ebc0cae71b8edd7717b32e63e0b33cef649b154560aeb4adce56a211833b","observation_id":"85324c3b-c3d3-4ad6-904e-fa33b94ec416","resolution":{"observed_at":"2026-08-05T14:22:35.279914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.266428Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"07d4114f-ca78-472f-be3f-712f3d67e889","year":null},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.993270Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:d1abade5e12f918bfb20a71f83eb964fd1d770f1f01509d964722d087d308604","observation_id":"48de1972-aa06-47ee-883c-a22d9a349457","resolution":{"observed_at":"2026-08-05T14:22:35.269972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:22:35.256702Z","title":"Answer: [Yes] Justification: As detailed in the Appendix B, we leverage OpenAI’s GPT-4o to create audio transcripts for the curation of PARADE benchmark","venue":null,"work_id":"66480334-69e6-423e-98aa-261816f7daca","year":2025},"citing_paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:34.997009Z"},"links":{"citing_paper":"/paper/2508.21376"},"observation_digest":"sha256:3d6d5592883042e5e521a52f84e37122943006ae9ac506da2949f52018b5fe30","observation_id":"913828ab-683a-4f62-91d4-fe2b0213da28","resolution":{"observed_at":"2026-08-05T14:22:35.259930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21376","last_updated":"2025-09-02T17:58:21Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T14:22:32.048856Z","submitted_at":"2025-08-29T07:40:39Z","title":"AHELM: A Holistic Evaluation of Audio-Language Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":47},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 10 inbound Pith citation observations for arXiv:2508.21376."}