{"as_of":"2026-08-05T18:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91cb97c0b5bb4908b7e2724d19e228724da58656828e679994bcb9b9195477cf","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:06:47.859998Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:57:11.349967Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02782","snapshot_observed_at":"2026-08-01T16:57:11.349967Z","title":"When audio-language models fail to leverage mul- timodal context for dysarthric speech recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-01T16:57:08.740216Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.349967Z"},"links":{"cited_paper":"/paper/2605.02782","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:73314421eaea6f9989b46fbac5afb9027de1c5006da4bb50c8b199fab99bf575","observation_id":"475bb423-9c3c-4c9b-aff9-f39783c5f9f6","resolution":{"observed_at":"2026-08-01T16:57:11.349967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.02782/citation-record","integrity":"/paper/2605.02782/integrity","json":"/paper/2605.02782/citation-record.json","paper":"/paper/2605.02782"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.494382Z","title":"Attention is All you Need , url =","venue":null,"work_id":"fa4d7178-75f8-4139-9b39-41030a2917db","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:2c554415136c3d310e12f231cba15dbd45f1f4444c7986ca073873289e38e3c5","observation_id":"48dd6110-208d-40dd-822c-182dc72dcd16","resolution":{"observed_at":"2026-05-26T05:51:46.854601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:75dd8a2114e7b9e12c46d913ba63360cbe1648ee2e120ef7741624e9421f2890","observation_id":"abfbf2bf-15ea-4e16-bd20-bb0be9f09530","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"3d0cffc3-6bf0-4aba-98d5-9bdf6ddc79c5","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:59a8d6ad29960caad5d8509e33cea45d1acc7717b37e731293908a0cffaff970","observation_id":"25f871f0-514e-4a1d-b2f9-725f1bf5a208","resolution":{"observed_at":"2026-05-26T05:51:46.843242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:24:28.355271Z","title":"2022 , eprint=","venue":null,"work_id":"ad4aaf4b-08d9-470e-a494-e9e235804375","year":2022},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:1cac37b39a57e10c9aed8fae7907a85703f880c2159489a4db05b9aabe569dc9","observation_id":"36730354-62dc-4052-bb4d-7221d63a623e","resolution":{"observed_at":"2026-05-26T05:51:46.846544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:01:40.116378Z","title":"2025 , eprint=","venue":null,"work_id":"7d865d23-e54b-417a-9927-62d06c9e3ce6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:db707b92068f56d1b81a0940cec2b329c6745a0b4830182f465613d832eec10c","observation_id":"382eb0ea-8551-47ea-aca8-ec0f3a8e9594","resolution":{"observed_at":"2026-05-26T05:51:46.835612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:23:43.352707Z","title":"2024 , eprint=","venue":null,"work_id":"a2fe15cd-a520-413c-b29e-a7183c7f33a8","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:62ed8bf9dda55da5e00140a28b18d2c1d48c401c83857644dc7754d931955b19","observation_id":"ef4927ab-c9a5-46fd-925a-068d7e2ed7d7","resolution":{"observed_at":"2026-05-26T05:51:46.839378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2008-480","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang and Kenneth Watkin and Simone Frame , year =","venue":null,"work_id":"0a73e349-2678-455e-a581-79ae30be97e2","year":2008},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:1b31438fbd8e40dbc4a8b882e522c40773c009830a5c578a7624cb82b093af30","observation_id":"a8570081-f8b5-49f8-a4c0-77433598c369","resolution":{"observed_at":"2026-05-08T18:08:53.429906Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The TORGO database of acoustic and articulatory speech from speakers with dysarthria , volume =","venue":null,"work_id":"364b765f-d802-402a-97be-c9757d718536","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:4c7c147f59d1cbec8b139a2ddab6dff0892b51127026d3670b3752b24adcc8b0","observation_id":"04cb6bed-f215-41a4-911b-333432346655","resolution":{"observed_at":"2026-05-26T05:51:46.850173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"f4495322-4026-448e-af67-11e0fca2d904","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:1b8c3e9110bfacecaec792dab965328a5d34e61bfe17ed464003f6f8cd17f9f4","observation_id":"9eee9828-d0d9-42c1-b5a3-2afd7d957b40","resolution":{"observed_at":"2026-05-26T05:51:46.859162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:df8103f1d89736861ef0b82eeaf618eca3fa055e00372fbbdb2b7abd306db185","observation_id":"00b9c6d1-0fe8-46fc-8ab1-067e2e28de5c","resolution":{"observed_at":"2026-05-08T18:08:53.438480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"2ab3cacf-c11e-41b7-a982-2585b017aefb","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:4240cbcdb91e09d71ec6abc27173877423fd5e5d846c4246f52ddb15805ea52c","observation_id":"1e592c9d-a193-465e-ac09-909bf9770593","resolution":{"observed_at":"2026-05-26T05:51:46.875307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01027","last_updated":"2021-09-08T04:12:36Z","snapshot_observed_at":"2026-08-04T09:17:59.235960Z","submitted_at":"2021-04-02T12:53:15Z","title":"Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training","version":2},"cited_work":{"arxiv_id":"2104.01027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.01027","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2104.01027 , year=","venue":null,"work_id":"fa4bdf2c-94e8-4197-ab68-ee0f965f7476","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2104.01027","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:0dd5c41903b00ccb125d5a5258c63703d0e0a8511a1276ac8b824cbaa01954c1","observation_id":"5f66ad36-d3be-400e-82e4-f5463f295cbe","resolution":{"observed_at":"2026-05-09T06:45:44.665734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:9ec8de0c4c59fce1c51f2a7d9f42f836489b25a0b813d7048090bb5e6e47354b","observation_id":"cfffa3e2-59ab-4fe8-8c71-e4ff17edcb33","resolution":{"observed_at":"2026-05-11T02:14:45.520303Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:21bcbaed9503a25beef2d7ca5a562aa633d175027a10b338d436a0581f541e04","observation_id":"cc47f93b-d4b6-46d3-98cc-71af1ef3e089","resolution":{"observed_at":"2026-05-11T00:20:38.220353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:c4572bb676dca5329171c0daae85bc1b3ad76fa282693bfcda7790e000a4ed78","observation_id":"b09c780d-ef32-4bd3-835d-1fb4239e4ed6","resolution":{"observed_at":"2026-05-13T13:59:09.287362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e8ecffd-841c-4395-8f33-25221648db77","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:ee01c28b61997f21e1454089c309618f49379ee987e49a2ef9ef9770070c7833","observation_id":"1f382364-325a-42ce-b87c-474eeecb3c28","resolution":{"observed_at":"2026-05-26T05:51:46.867064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b119dcda-e0af-4561-8bbb-f3678ae2cc61","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:f2a6aeb1bccf7414f51de0a870e20a62c02a6e31165b02be2e52598941b98e43","observation_id":"afc141da-f4c4-4e2a-b833-c8411c26ee84","resolution":{"observed_at":"2026-05-26T05:51:46.870905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , howpublished=","venue":null,"work_id":"9388cd5a-7c47-437c-b80a-e4de8ad1121d","year":2026},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:db600f3a2d6838d0a6fd9679623df466d228deff9af0bc6e3d5e19f6dc0894aa","observation_id":"759082b8-cc24-4121-bb31-9339ad7052b4","resolution":{"observed_at":"2026-05-26T05:51:46.808050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b4006b9e-257c-48c9-84f8-24122f6a13d6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:31d2eec0dd3637a042ca285abbaf70d8cb75a8bee3676f3968b6b10d9b8d7877","observation_id":"815abc3d-fa9b-4526-a1cb-69c235784603","resolution":{"observed_at":"2026-05-26T05:51:46.820714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":"2509.18154","doi":"10.48550/arxiv.2509.18154","metadata_source":"pith","pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","venue":"cs.LG","work_id":"21d4b019-63d0-49e5-b51b-350ef4783709","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:d953765c091079cc3486707c13ddccd064bbe48476f2b61e6219c3df24c2ba65","observation_id":"9e2681ed-8247-4c3e-9b71-7ab2d1ea266f","resolution":{"observed_at":"2026-05-15T17:07:27.685083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"80a63d91-530c-40c2-8e01-ebd72b107e8b","year":2026},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:5bb580437ac4ef2b0a90abfce5b339acc5a395e64fe164339f2731ee5ed9fcd8","observation_id":"0606d955-6152-4192-92aa-d46fb9b50092","resolution":{"observed_at":"2026-05-26T05:51:46.827925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"56cb175d-2ee8-4d18-a6be-74f802482371","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:9e53b2659bb822f4f47f2788fd81cdb581f3d5df5b1829f3cc52dfcf45100e50","observation_id":"a69bc087-7e50-403c-b22f-74aaddf284c1","resolution":{"observed_at":"2026-05-26T05:51:46.831903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"0bceb993-9434-409e-9b6c-82feeaa31c4f","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:b91a8a4439207163774185ff9b662b7189dd4ec2676d788b4f81d18a050fb56e","observation_id":"17fb27cc-669d-4ee4-8bf8-e2a22b41866e","resolution":{"observed_at":"2026-05-26T05:51:46.800656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"743bac57-9d79-4137-94ad-19ce76c92e08","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:a79267d060f920f8c02a19fbcc8f20cba20f9b0fd2133bda76f7006f5a5ba27f","observation_id":"8494eeaa-22d6-4b7f-a522-ee7c528f3cf9","resolution":{"observed_at":"2026-05-26T05:51:46.789546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.847372Z","title":"2020 , eprint=","venue":null,"work_id":"f08d1287-d312-42b6-ad4b-5e5b86442250","year":2020},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:f82873436e23cde769eca66d1c6ba36665d447d305fc6f491b5d58aa8cb528cd","observation_id":"a3f07603-28fe-4459-8fc2-99edfeb344cc","resolution":{"observed_at":"2026-05-26T05:51:46.781921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.152657Z","title":"2019 , eprint=","venue":null,"work_id":"4c41a8dc-7f3a-4093-96ed-9cb29b926433","year":2019},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:0fa4c9df86f01d763efcc75c0124982ade7cac3ae4e9ed187425ca9a315a1214","observation_id":"3138e4ef-d2fa-4e0f-affc-18745287b4e0","resolution":{"observed_at":"2026-05-26T05:51:46.778031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"40f8a687-1135-40f5-91b4-43a8d73e41f6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:98ea70960b9f35c2d2294e8ad9d00f7e1a4f9ee9f720e93425b906e6fdedc956","observation_id":"f819bf0d-ead0-479e-af11-d0ace543000a","resolution":{"observed_at":"2026-05-26T05:51:46.769333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"ce65e02c-5b4e-43c1-b7ca-83e1cb608233","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:58075066b4d05e073e1f8d1917b41b8552be7eb4deff35eb5490fcb5c9729494","observation_id":"82b25f50-6f04-4bd9-a567-13d95ccd4b42","resolution":{"observed_at":"2026-05-26T05:51:46.773634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"0d885b27-f816-4d33-b491-bc41ddfd5cab","year":2020},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:c73dc45bdf6527510e11571dc7cb1d92b065e05d384e5e7c4e00bfbdf281a454","observation_id":"47434211-2451-46ad-b537-05a2aad74924","resolution":{"observed_at":"2026-05-26T05:51:46.785680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"State-transition interpolation and map adaptation for HMM-based dysarthric speech recognition","venue":null,"work_id":"86156880-e257-4e97-8946-2d630a670186","year":2010},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:611f6448068122783cf99b162ca70be6a47d0b7f15ec1a5fb2e47a4ad0d7c2e2","observation_id":"dae98243-70fb-40e5-a150-56d58d85fa51","resolution":{"observed_at":"2026-05-26T05:51:46.793600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimation of Phoneme-Specific HMM Topologies for the Automatic Recognition of Dysarthric Speech , volume =","venue":null,"work_id":"13d62ceb-4bf3-4a21-9cb3-98b167c34a7b","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:ec4a42a7b79f190b313dce5fad8eaf74770cd02ad5d62d6b3d179d9634d2d3b8","observation_id":"d8a3375b-1393-40c3-995f-9075ae3be6bd","resolution":{"observed_at":"2026-05-26T05:51:46.797546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Interspeech 2016 , pages =","venue":null,"work_id":"3dc986e7-9099-4d48-bbf8-5e7c58bcb18b","year":2016},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:4e0554127e7d5c83b93dc15a519d4077029c6ec2533cbe6d0c3337f3698bd388","observation_id":"f9fb7c86-9838-4fd6-9a3e-fac60b4e4ccd","resolution":{"observed_at":"2026-05-26T05:51:46.765101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Interspeech 2023 , pages =","venue":null,"work_id":"e4ae7319-6e28-4102-a346-97b6d79eb464","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:7767baec5d601b09a7c6286daef34a18c967519922c2569eb3f5ab708806f751","observation_id":"461654aa-6da6-4048-92e6-80c647603d53","resolution":{"observed_at":"2026-05-26T05:51:46.804302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.compbiomed.2025.109954","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Two-stage data augmentation for improved ASR performance for dysarthric speech , journal =","venue":"Computers in Biology and Medicine","work_id":"2f2fca1b-5a36-4ec3-a229-b0de643b53da","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:1425c0111868da40adcbc0ff7fdacc3319a4c7f0f0a7b94916c277e185e33f75","observation_id":"eaf12820-967b-4bd4-b1bc-4aa1b86833ce","resolution":{"observed_at":"2026-05-08T18:08:53.426444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"c60dd660-3b69-47f5-9f50-5f2083657196","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:9638332a4814d8c9bdb80841bd1d665d8f69862c40055ee1cc4b77afe1b547e4","observation_id":"43211658-e092-48a1-a61e-a4f84dfb50f8","resolution":{"observed_at":"2026-05-26T05:51:46.824345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"ac0d2df2-c619-4805-be47-d534c7b52cac","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:d893378077cc163c2b52ff66f0f0cf0e0a271673fbc1a1c5cda39dbfe65cbacb","observation_id":"cd90e2c1-92c2-4c4b-b8ec-92aea2305c8f","resolution":{"observed_at":"2026-05-26T05:51:46.879111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d966e588-a9c1-4684-8a89-a379e258b31d","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:268f442349e045173437ebe8ae44359ca28114249dee7785636c0c81828ef5fa","observation_id":"bdbdef6e-27b8-4b95-9824-665614cd2726","resolution":{"observed_at":"2026-05-26T05:51:46.816987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"27afaf45-99bd-48ac-828a-af4ea8c95569","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:99df4c118e6365d99051358cff75793e46f79da71aeefe0697f29712e7b5483f","observation_id":"bb9911bf-b8dd-4e10-a4bc-14ad09125cdd","resolution":{"observed_at":"2026-05-26T05:51:46.812244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"71c301fc-1393-4f93-a82c-341a3edebc77","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:8470280534a8f9fb3ecc5e2d2327848a5aebf702f10ae252636c7748da16838d","observation_id":"89fc1373-6409-4701-b7ee-bfb6bc4d0f5d","resolution":{"observed_at":"2026-05-26T05:51:46.748914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.apmr.2024.08.014","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Urbina and Peter D","venue":"Archives of Physical Medicine and Rehabilitation","work_id":"6601a1cf-da0a-4d4d-a33d-59b1d8ecddb6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:2606666a0f499892838e28a89cde8b888062bca66339aa7512e894deec466af6","observation_id":"3521aa13-a46a-4964-af84-f56b5b91586a","resolution":{"observed_at":"2026-05-08T18:08:53.433304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3726874","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , howpublished=","venue":"ACM Transactions on Accessible Computing","work_id":"7ca754e4-b5e2-4818-8b07-1df55f5ce11d","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:4c7222a496e2ad94b93ab54ff78ae1648551c84ce42bc5cb2497584ad2b26853","observation_id":"a0f455ef-ccc3-45eb-9e62-687c2a082f53","resolution":{"observed_at":"2026-05-08T18:08:53.416248Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jcjq.2023.10.006","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024 , howpublished=","venue":"The Joint Commission Journal on Quality and Patient Safety","work_id":"a09f0420-dba0-4498-9c3a-1634a348c54d","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:4ce1eac5a5a0bd542cd291f01f17024b5295c2012395fa7a44497d3e82338647","observation_id":"9e1483b4-ded0-4f9d-9019-0125eab270ec","resolution":{"observed_at":"2026-05-08T18:08:53.412609Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.253485Z","title":"2021 , eprint=","venue":null,"work_id":"8e6d7443-6b29-4f76-94d1-3661d5f2a5ec","year":2021},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:dcd9c323b72579510ef100d4481c8d095121241792f2b1a8d56c5d027dcc22ec","observation_id":"b81bdc27-f711-4033-b93e-b126e8981e4f","resolution":{"observed_at":"2026-05-26T05:51:46.753016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"05d55caf-5350-49f7-ad23-8e20a5367609","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:5b3d35b054a4496738f03031e03ed0645a588e9c4069c8b01e690426b0a32171","observation_id":"0ec50091-831a-430d-b2c4-7fef8c9c57a1","resolution":{"observed_at":"2026-05-26T05:51:46.756634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/jstsp.2022.3182537","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"IEEE Journal of Selected Topics in Signal Processing","work_id":"1d0b6fda-c8e0-4de3-8b36-e7c2e0c88cf3","year":2022},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:473b98198f8216ecae35d3921770bacd46bfe5f216c7d917a5e687cc1961c764","observation_id":"aa6951c3-96c7-4afd-b77e-7d82356f5c13","resolution":{"observed_at":"2026-05-08T18:08:53.421100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title =","venue":null,"work_id":"59d4525f-b646-4a27-af44-0b38c0213c3c","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:861cb1d99c12f12eaf7c63bd3c893b76cf529f11e37d7801ee81c985e910e1a4","observation_id":"1a996b29-27d5-42a3-8a09-cd3a1776eaad","resolution":{"observed_at":"2026-05-26T05:51:46.760948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1044/2024_jslhr-24-00045","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Nelson, P","venue":"Journal of Speech Language and Hearing Research","work_id":"2ade4fe5-16b5-4339-87bf-9452b4c3c0bf","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:de961e3d59f9b01542212cf62e4df3d8dfbe81929658dc213ade18af0881c519","observation_id":"6b7df4a9-0a82-41b1-b131-09227a6b6037","resolution":{"observed_at":"2026-05-08T18:08:53.408648Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Population: The 2012 National Health Interview Survey (NHIS) , author =","venue":null,"work_id":"7106a2a8-06cd-425b-9ec6-e0317fef5d4d","year":2012},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:579584ea815fa41e154a7ab91dc0b9d0bb16a6473645a756b1fcd6c6187a4215","observation_id":"effc897b-06b1-4270-bd68-ecdd91200da2","resolution":{"observed_at":"2026-05-26T05:51:46.745153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition , year=","venue":null,"work_id":"a57119d0-5961-41df-a64c-901b1f467217","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:a94e6ef862645c5a69fc8d2138b7bb612ca5ea133a4cc43137397ad7381c08ad","observation_id":"b951dcaf-82a2-4d5c-8d66-6fcbb76bfa96","resolution":{"observed_at":"2026-05-26T05:51:46.741151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2012 , publisher=","venue":null,"work_id":"45d29fdb-aea5-4504-b011-eaae58307084","year":2012},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:affba7d8e85c9c09dc9e3fc4b9de5c422155e57c99759eb3e40c4fca6f6388a0","observation_id":"b6eb8d56-71e8-43f0-8c4d-c461aa698559","resolution":{"observed_at":"2026-05-26T05:51:46.863170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":10,"verified_fuzzy":34},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2605.02782."}