{"as_of":"2026-08-10T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1af32efaff72fa76c829bd2372ed7631c5cf1c916f330bbb3e472e49647538d","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:18:01.686274Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:51:15.098039Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T22:52:44.973580Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2505.22251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22251","snapshot_observed_at":"2026-06-28T22:52:44.973580Z","title":"Evaluation of llms in speech is often flawed: Test set contamination in large language models for speech recognition","venue":null,"work_id":"1c3cb60f-fb00-4678-a5e8-e7485c30c7dd","year":2025},"citing_paper":{"arxiv_id":"2601.12248","last_updated":"2026-05-10T16:47:20Z","snapshot_observed_at":"2026-07-06T22:42:03.665045Z","submitted_at":"2026-01-18T03:55:28Z","title":"AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:17.935630Z"},"links":{"cited_paper":"/paper/2505.22251","citing_paper":"/paper/2601.12248"},"observation_digest":"sha256:bd5c3d74f3828ba13cf67bb1f75a2a0a841677799c518c8e5d9f855f9cb60e03","observation_id":"57f39226-af22-4d2e-bf6f-cf48af4400e7","resolution":{"observed_at":"2026-05-16T14:07:58.664363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2505.22251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22251","snapshot_observed_at":"2026-06-28T22:52:44.973580Z","title":"Evaluation of llms in speech is often flawed: Test set contamination in large language models for speech recognition","venue":null,"work_id":"1c3cb60f-fb00-4678-a5e8-e7485c30c7dd","year":2025},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-05T12:06:36.882921Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2505.22251","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:cfac10bf7f76204c00f76f0570e855dd7ac8df24d869ed66b574bf51a6e75d32","observation_id":"a74ba727-e03f-42d1-a4b3-ce8ce35bf26d","resolution":{"observed_at":"2026-05-12T00:41:26.371213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2505.22251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22251","snapshot_observed_at":"2026-06-28T22:52:44.973580Z","title":"Evaluation of llms in speech is often flawed: Test set contamination in large language models for speech recognition","venue":null,"work_id":"1c3cb60f-fb00-4678-a5e8-e7485c30c7dd","year":2025},"citing_paper":{"arxiv_id":"2606.07608","last_updated":"2026-05-29T13:43:57Z","snapshot_observed_at":"2026-08-10T04:00:56.008698Z","submitted_at":"2026-05-29T13:43:57Z","title":"Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:51:15.098039Z"},"links":{"cited_paper":"/paper/2505.22251","citing_paper":"/paper/2606.07608"},"observation_digest":"sha256:5f5b4f7ec0fef28fbc3916d3ead95eba4c9b65cab3238bb1598e4f0cc6b12290","observation_id":"7dcc69a9-dd97-4fa6-aa8c-2094b28938bd","resolution":{"observed_at":"2026-06-28T22:52:44.975160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22251/citation-record","integrity":"/paper/2505.22251/integrity","json":"/paper/2505.22251/citation-record.json","paper":"/paper/2505.22251"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.929100Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":"fae5531e-1a70-483f-8732-a596fac0cf76","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.672482Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:769556cb717b3c01c9b15d93e62f5019b6cd58cd92685fb23cc7341f9121d430","observation_id":"e51946b5-eedc-4742-9706-00bb3ea0841f","resolution":{"observed_at":"2026-08-07T13:18:06.007622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.755986Z","title":"Salsa: Speedy asr-llm synchronous aggregation,","venue":null,"work_id":"c9af80d5-cebb-4fae-adee-6553fe088fa1","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.773788Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:deaf9a5b198b809f0685da6f00a88d964f0a7b45e28e79a9463dc5064452f0f2","observation_id":"82ca8082-c047-4b76-aa76-599ae9d6f911","resolution":{"observed_at":"2026-08-07T13:18:05.832740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.573615Z","title":"Delayed fusion: Integrating large language models into first- pass decoding in end-to-end speech recognition,","venue":null,"work_id":"49aa09c9-a421-429d-aff8-ae31b6f13de1","year":2025},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.878148Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:800383956c97113c5c8d4a15bfa061065a59785d0539870a00ea74928a980de3","observation_id":"e5c9e119-9eac-45d8-a44e-e4032f22e4fb","resolution":{"observed_at":"2026-08-07T13:18:05.655581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14259","last_updated":"2025-06-11T17:09:58Z","snapshot_observed_at":"2026-08-07T05:58:57.740955Z","submitted_at":"2024-05-23T07:39:42Z","title":"Let's Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14259","snapshot_observed_at":"2026-08-07T13:17:57.992010Z","title":"Let’s fuse step by step: A generative fusion decoding algorithm with llms for multi-modal text recog- nition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:57.992010Z"},"links":{"cited_paper":"/paper/2405.14259","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:b7bfc8e18758bb8a110c8fc26f81d0f5f9bef1842638baec5c158d668ab214f3","observation_id":"a97d9d19-e543-44ee-8123-a8ea3890fc73","resolution":{"observed_at":"2026-08-07T13:17:57.992010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02248","last_updated":"2024-06-14T17:57:13Z","snapshot_observed_at":"2026-08-10T13:07:09.316381Z","submitted_at":"2023-11-03T21:47:03Z","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02248","snapshot_observed_at":"2026-08-07T13:17:58.104459Z","title":"COSMIC: Data efficient instruction-tuning for speech in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.104459Z"},"links":{"cited_paper":"/paper/2311.02248","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:3621bfb2c044bac9c35eed1fd1bbd2e9e93729d30783e31afd3fc7dc73e82b9c","observation_id":"30f794d4-eb9c-47e0-a134-779f495bdd9f","resolution":{"observed_at":"2026-08-07T13:17:58.104459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.404322Z","title":"On decoder-only architec- ture for speech-to-text and large language model integration,","venue":null,"work_id":"d7209199-02bd-4bcc-8e0c-91499a98efb0","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.185843Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:c8569bc3cfb0c83b126877a60cfe5f90ac1ee10210e36a9a107792828c67d377","observation_id":"1848cb06-81ef-41d0-ae81-f904473fe067","resolution":{"observed_at":"2026-08-07T13:18:05.481616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04172","last_updated":"2023-09-29T07:32:03Z","snapshot_observed_at":"2026-07-06T15:51:50.675471Z","submitted_at":"2023-07-09T13:38:25Z","title":"Can Generative Large Language Models Perform ASR Error Correction?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04172","snapshot_observed_at":"2026-08-07T13:17:58.378986Z","title":"Can generative large language models perform asr error correction?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.378986Z"},"links":{"cited_paper":"/paper/2307.04172","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:b42fd484166d6523196a4c7e6df3bf84d932c870559ca1106467c452ec3730aa","observation_id":"f2334377-8217-4782-9570-370dd76bed53","resolution":{"observed_at":"2026-08-07T13:17:58.378986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:05.160165Z","title":"Contextual spelling correction with large language models,","venue":null,"work_id":"7a646f77-f793-4598-ad3c-fc16dae6ad18","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.491470Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:c9da38e2cdeaa1de646cfd4fb8a5619ad234f45767318ebcf44031424161137b","observation_id":"579a16f0-cc67-44db-8fc6-063faad13915","resolution":{"observed_at":"2026-08-07T13:18:05.269833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:17:58.590808Z","title":"Denoising LM: Pushing the limits of error correction models for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.590808Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:4c85521ac6bcaf2550d8d985fff52b2525b61fc20d07cd0562f8df47a5c516aa","observation_id":"bd9d0c1a-9bd8-4a7b-af49-08c078b1c8bc","resolution":{"observed_at":"2026-08-07T13:17:58.590808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.975806Z","title":"NLP evaluation in trouble: On the need to measure LLM data contamination for each benchmark,","venue":null,"work_id":"c8f601c2-c5e0-49e3-85bd-b10d8660c894","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.719183Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:d0619805f5108ac7fd93aaf180cd8fe78630d2721aa0ad462bbfc3d79f9caf03","observation_id":"20558f48-2ba2-4662-9ace-e767da79a8bc","resolution":{"observed_at":"2026-08-07T13:18:05.065536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.840777Z","title":"Data contamination: From mem- orization to exploitation,","venue":null,"work_id":"2f2545e0-7b6f-4aad-aae1-c0b83abf884e","year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.845669Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:34ad9c927ed1dce9dca9307d6fcaf0daad36f9abc4a634b6a13e1216ef3be3ac","observation_id":"a5fbcd1b-5a4b-473f-92be-3d3fc27230e3","resolution":{"observed_at":"2026-08-07T13:18:04.910943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.670717Z","title":"Leak, cheat, repeat: Data contamination and evaluation malpractices in closed-source LLMs,","venue":null,"work_id":"2d6e1315-7064-4c5e-87bf-9b308bbfde8e","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:58.921580Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:cb3e1509058d32aaf2efdfda46b03846bf5df71e439c29e622c4ee7249c14db6","observation_id":"d0f92251-4b5d-4cd0-9784-3197c3cb07ae","resolution":{"observed_at":"2026-08-07T13:18:04.742613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.502685Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"47ddf890-94c6-4995-aff2-9939a75d6f5c","year":2015},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.019387Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:0b2528a1d62837fece8eb595a831d0dc3226ec493a65a16cb66d6929b1f9b93f","observation_id":"2cb5b22d-a54c-4581-8366-baa3bdd85dfa","resolution":{"observed_at":"2026-08-07T13:18:04.572516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.399937Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":"379d3ad6-d66c-4a1f-90fd-045ed3292ab0","year":2020},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.145288Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:226c7e2808d3f0c7db261b72c9edda9b19dece4a0d23e0d1cff2309273564fc3","observation_id":"e27156b0-dd5c-40d6-ac32-2675cfb83de5","resolution":{"observed_at":"2026-08-07T13:18:04.448183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:17:59.257220Z","title":"The Pile: An 800GB dataset of diverse text for language modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.257220Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:727549d29eaba7a4eea88425b28a3903a6543f8a5ac734a6dac80b4ec3a4a4bf","observation_id":"66807b87-4d71-456c-b571-8ab88bb88c99","resolution":{"observed_at":"2026-08-07T13:17:59.257220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.255581Z","title":"Comparing discrete and continuous space llms for speech recognition,","venue":null,"work_id":"7f50d5ea-c850-45a7-bcaa-8d376aa8067d","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.330018Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:ee70af68245135361300cf5a6868de9959ea67e9003219d9a336ce1b4a19da49","observation_id":"ae18e7e6-64e0-4c1d-bd23-23fa1a04c57a","resolution":{"observed_at":"2026-08-07T13:18:04.342946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:04.004153Z","title":"Connecting speech encoder and large language model for ASR,","venue":null,"work_id":"860ab910-3852-4c6b-8729-e47cdec47658","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.495385Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:35486563931bd04428e7c81160e61ce766db736004898c59967f9cb57b7e02cd","observation_id":"47c931db-4bf3-46f6-aa78-2b90cefacb9d","resolution":{"observed_at":"2026-08-07T13:18:04.063947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T13:17:59.596297Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.596297Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:f7eded72c48c736f7ad3254bf4a459967d7b22c31c5d9c90a643cb73fa720af6","observation_id":"d87d8bc6-a3bb-4405-8617-b3fdbe805c69","resolution":{"observed_at":"2026-08-07T13:17:59.596297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-09T20:04:27.847882Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T13:17:59.761074Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.761074Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:17a0887992d00858ebdc10b27cf06096f3711c171942f7d963d818367f6d68fd","observation_id":"0901f8d5-522a-4fc3-9a6d-41b30ebce6f4","resolution":{"observed_at":"2026-08-07T13:17:59.761074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03752","last_updated":"2024-10-02T01:54:35Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-02T01:54:35Z","title":"Efficient Streaming LLM for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03752","snapshot_observed_at":"2026-08-07T13:17:59.819028Z","title":"Efficient streaming llm for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.819028Z"},"links":{"cited_paper":"/paper/2410.03752","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:23660b8a107728b9e4f689816ba9d4e7ad33d16a3d3eda5d5d20f113508077d1","observation_id":"a7b04456-488c-47da-9c15-3d516c30a64f","resolution":{"observed_at":"2026-08-07T13:17:59.819028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.893920Z","title":"Ctc-assisted llm-based contextual asr,","venue":null,"work_id":"39a82c37-123d-4b5a-b791-4f936a649090","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.878246Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:e637d50078b4081e7f01695663b37c55948934937e7c1d718e98199121980166","observation_id":"0dc9d712-d060-4667-a2c6-104c24596087","resolution":{"observed_at":"2026-08-07T13:18:03.950181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.752042Z","title":"The bigscience ROOTS corpus: A 1.6TB composite multilingual dataset,","venue":null,"work_id":"a98e9c79-7d57-49b0-8048-c5d047bcd464","year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.974379Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:9d0e0787924ecdd4cf57024f1a82602cc9d844a4180e00f6723b3772ef10fb5c","observation_id":"93838fd6-cedd-4eff-9577-2989b3746f90","resolution":{"observed_at":"2026-08-07T13:18:03.828371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.643084Z","title":"RedPajama: an open dataset for training large language models,","venue":null,"work_id":"4e8ab574-0baf-4797-a76e-1a07d4e842b4","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.145791Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:fc7a4524520b3aa76bf55d9fdf4ac52a79cf95b69af5a8ffbb14d6bdbd1a8407","observation_id":"813bbacb-f1be-4c2e-a6b9-3ceb4ffffae6","resolution":{"observed_at":"2026-08-07T13:18:03.691614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.490943Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research,","venue":null,"work_id":"ce2e53b3-1c7f-45ce-8a19-c952b875f0c5","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.241349Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:90ca0799e6fd9231c3afa860a88b2aceb2ffa4938b22ddeec5073db9e568e4ea","observation_id":"9508cdb2-5227-4d14-89d6-c753b08e84fa","resolution":{"observed_at":"2026-08-07T13:18:03.572575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-08-07T20:30:00.414611Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-08-07T13:18:00.321479Z","title":"LLM360 K2: Building a 65B 360-open-source large language model from scratch,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.321479Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:80ff3a7c0ed8ec0b53f0627d6568308b9e3c2b0e18a73ea94f0fd386c760fe29","observation_id":"bca93d8b-50e0-40af-ae8a-631cc3c33fcc","resolution":{"observed_at":"2026-08-07T13:18:00.321479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:18:00.418973Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.418973Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:f63586e58b0ea46f7757de144834cd0688ad51860d510065f505ea4be4d1ea03","observation_id":"dac2a22a-6122-4127-b0af-09d970d02d07","resolution":{"observed_at":"2026-08-07T13:18:00.418973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:18:00.496111Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.496111Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:598818ea3bd7b18347e56477a3bbdfc3178d3a65599b9a9bceb41db1d39304b4","observation_id":"fe0a6792-3ef8-4a52-bd2e-d1347e81dd8e","resolution":{"observed_at":"2026-08-07T13:18:00.496111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:18:00.592114Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.592114Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:e6b157ae55f1a6596651ea5baf07f2a84b435ed6cacc7723c2481013d9d4717d","observation_id":"ae8ac505-2c60-4ce1-a392-e459fc14b16d","resolution":{"observed_at":"2026-08-07T13:18:00.592114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.300881Z","title":"Leskovec, A","venue":null,"work_id":"76228c04-12e8-4573-ab92-0088ed7c7d66","year":2014},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.715018Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:10c8a6642ac87c5d865880165c100f3143488e5751642748c4252ecc538a63bc","observation_id":"d1012a3e-8e98-4224-8bb6-a5961c78016d","resolution":{"observed_at":"2026-08-07T13:18:03.390008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:03.127861Z","title":"Benchmarking non- parametric statistical tests,","venue":null,"work_id":"293f04c3-c8e7-4610-9623-e1703c642092","year":2005},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.810541Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:c3b27af774d1956c48a6e2082f61b9c76b67dba2ec0cff198910614d3af44054","observation_id":"963276c5-1b92-4756-ae75-7220c0c22c4b","resolution":{"observed_at":"2026-08-07T13:18:03.213721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:00.895479Z","title":"Confidence intervals for evaluation in machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:00.895479Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:20f1950c53b182951d4b5b899a18d586d2a33da1fab7f16919290d37c648f4e9","observation_id":"3e11ba02-3e84-4659-b8b7-06f2db9663c4","resolution":{"observed_at":"2026-08-07T13:18:00.895479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.916394Z","title":"Pythia: A suite for analyzing large language models across training and scaling,","venue":null,"work_id":"9069fb41-417e-4235-b0cc-c3c67d9d73fc","year":2023},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.017697Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:d0df51bbe78a5623c516da5e6bb3af92838dc7a2cfe886aece18e1a067e35e11","observation_id":"2ca12751-7f35-42c3-9e4d-f0963c7c566a","resolution":{"observed_at":"2026-08-07T13:18:03.032271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.778769Z","title":"GPT-NeoX-20B: An open-source autoregressive language model,","venue":null,"work_id":"850f8503-c53e-4935-9520-687e904657c5","year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.144965Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:bd3e8454fd5e3a79add0ad1506cca62c127026fdd2a43aba4aea9b9eae705dee","observation_id":"987ac905-bc74-4c2f-9c94-179b75bebcc4","resolution":{"observed_at":"2026-08-07T13:18:02.840529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T13:18:01.230964Z","title":"OPT: Open pre-trained trans- former language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.230964Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:49f4b72a57474ffcb95859ae013e75ec02854dd1cf2cb8216fd1b05164cddc35","observation_id":"72c03d69-2317-4751-a8c3-9cb4bce3e637","resolution":{"observed_at":"2026-08-07T13:18:01.230964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.616907Z","title":"OLMo: Accelerating the science of language models,","venue":null,"work_id":"e0fbf484-7abd-4ca2-a784-547a87892e95","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.319044Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:3fad44efc2735aeb5e1eebab3f26bad0e022aecd92996465e5f6b93f58a760a4","observation_id":"f7103772-83af-47fd-a90e-5ef74418b67d","resolution":{"observed_at":"2026-08-07T13:18:02.677131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.387752Z","title":"The secret sharer: Evaluating and testing unintended memorization in neural networks,","venue":null,"work_id":"3d241310-723a-49d3-9aa7-27b1b40d4181","year":2019},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.409238Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:be03abd929471861122bc0e32aa37cd80409e7cfd6fc27a16ff660319b0c2a02","observation_id":"532a5e63-10f6-4de3-a0a2-77984b0eeef9","resolution":{"observed_at":"2026-08-07T13:18:02.534516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.268553Z","title":"Open- source conversational AI with SpeechBrain 1.0,","venue":null,"work_id":"056244ff-15f2-4a5a-bf2b-98a5b31c2a8e","year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.500777Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:7d18e0a722cb92397ae7efe9e333a479f7455b602fdec3868248a32ca5171203","observation_id":"21b8daf0-bacf-4925-9322-a8e58f77506c","resolution":{"observed_at":"2026-08-07T13:18:02.316139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:01.593951Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.593951Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:58a792c767ac36768f9bb384876d3137dfe9761c1748d31f6e0cabb47cec8b6b","observation_id":"69c183be-540d-4daf-9b3c-65659e666f3c","resolution":{"observed_at":"2026-08-07T13:18:01.593951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:18:02.022210Z","title":"SpecAugment: A simple data augmen- tation method for automatic speech recognition,","venue":null,"work_id":"a8c7ccbe-b891-4cc7-9321-8667401299d7","year":2019},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:01.686274Z"},"links":{"citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:e1dc2af41ef1503446494842b84628ebc46924a3d41d14d54e708b34f06ce074","observation_id":"50495929-d525-42b5-8230-3f8f68f3cb4a","resolution":{"observed_at":"2026-08-07T13:18:02.141680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T03:03:49.691180Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2505.22251."}