{"as_of":"2026-08-22T06:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbd9774237b48f714e4f3e55472d0b88282903074df9604051f205630c04d74c","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:57:11.668450Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17812/citation-record","integrity":"/paper/2607.17812/integrity","json":"/paper/2607.17812/citation-record.json","paper":"/paper/2607.17812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:09.057511Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:09.057511Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:a1ce056b62aeda703bfd667a9bf38801ff72adcb881fca2382886d9952f464a3","observation_id":"fb43b3f9-195f-4b6b-a7bf-c6d39dc0b634","resolution":{"observed_at":"2026-08-01T16:57:09.057511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:09.232035Z","title":"video-salmonn: Speech-enhanced audio-visual large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:09.232035Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:40101e4563da6f61cff62e398c1f56341274fb0df183f5a911220f9c940e3b2b","observation_id":"393ac4e8-c1c1-423d-a387-d8e2e1227fa4","resolution":{"observed_at":"2026-08-01T16:57:09.232035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:09.546080Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:09.546080Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:dbfec39ae16eb35d83b5519493c7d135cb05d4a25edaae484e3a92bcbbddaf36","observation_id":"60c21802-fd7d-471d-a0d7-4bf5388a1493","resolution":{"observed_at":"2026-08-01T16:57:09.546080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T16:57:09.654669Z","title":"Qwen3-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:09.654669Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:95818aae105324cd4c50f47a5b59f1febc1952f27ddd4461456b9d941be59c1d","observation_id":"f9a26cce-429a-41b9-bf75-bb2879ed9087","resolution":{"observed_at":"2026-08-01T16:57:09.654669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-01T16:57:09.840855Z","title":"Kimi-audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:09.840855Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:b6565d7349877747d16665dc417618e093108a726fd64ec8fc298ff1283d0540","observation_id":"0419729f-72c5-4f6c-a313-98f22573063b","resolution":{"observed_at":"2026-08-01T16:57:09.840855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:09.961025Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:09.961025Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:6a0da67bfef3e1202eb6fab135ed383048b00a13c1469fea6bc56b9a702a27f5","observation_id":"3e385f4e-6eb8-4910-830a-34a5d77b6b0d","resolution":{"observed_at":"2026-08-01T16:57:09.961025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.257358Z","title":"Dynamic-superb: Towards a dynamic, collaborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.257358Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:12de9f6e3181d8a98598a7f300ebd075f8e6db5b22c9695b68922a12f12f5f2f","observation_id":"dba9b04a-a78b-4892-ad20-cb005b24f8ea","resolution":{"observed_at":"2026-08-01T16:57:10.257358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.359096Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.359096Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:e293268cf9edf67027c092cb99f9fb80b965a3586d717486329b657fa91097a1","observation_id":"6857c409-0c0f-4d13-bdb6-481f409a1da4","resolution":{"observed_at":"2026-08-01T16:57:10.359096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.402494Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.402494Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:01c40b91a012c538d8cc0b6263e6d6a00d31365c86c6b84b239dd1846bcbb2a0","observation_id":"8f2031ea-6c8c-4b43-a9ff-d089d0688335","resolution":{"observed_at":"2026-08-01T16:57:10.402494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.415839Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.415839Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:42fad4360b8feaaede2aa5613d56ecb685c8f534e86d027d131b5af9f3a96837","observation_id":"175f8ed8-c8f0-44af-9cc6-a55ed03ee30b","resolution":{"observed_at":"2026-08-01T16:57:10.415839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.476880Z","title":"MMAU: A massive multi- task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.476880Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:f6ae0724acc9f1471b1ec90e02dc761094b6bb1080ac85bd42ce73850052bc7e","observation_id":"051d9b74-2257-4828-b60a-3d163d68e604","resolution":{"observed_at":"2026-08-01T16:57:10.476880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.558944Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.558944Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:e0e2c6139ee52daec6d687a81fee5e0f4e9417acc145c8cf6eeedf0b1a341fa5","observation_id":"d5df37c1-9e15-41a2-a577-ca0cea4b0747","resolution":{"observed_at":"2026-08-01T16:57:10.558944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.671527Z","title":"SAKURA: On the Multi- hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.671527Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:914bae9dfed68c03abd4fd4d9bc7f4ee281358ec17e8c522e29f063c2cc64d39","observation_id":"2339e3eb-75d8-48dc-92b0-902fc4147dd4","resolution":{"observed_at":"2026-08-01T16:57:10.671527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-15T11:17:04.997179Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-01T16:57:10.773561Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.773561Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:f1f42ddf4995fc0d13a16ca846d0a1d4f7797dee27497481751a128b5a99f691","observation_id":"193549c3-989e-46d2-b4fc-63ef0f442d69","resolution":{"observed_at":"2026-08-01T16:57:10.773561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.911529Z","title":"Mmau-pro: A challenging and comprehensive benchmark for holistic evaluation of audio general intelligence,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.911529Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:117d6a160e9180455cbde35c6c18c69eb187d42ba2debf75ee0d05874b3371f4","observation_id":"f1cd8a41-ce55-4f94-8561-e12ce6727312","resolution":{"observed_at":"2026-08-01T16:57:10.911529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:10.969687Z","title":"The torgo database of acoustic and articulatory speech from speakers with dysarthria,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:10.969687Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:de0c220454ea69404116018c9fea1b684b59a3534e33a6a8ff7485d149f4ce9f","observation_id":"793ac652-4e23-4fc1-a7e9-c145fb195047","resolution":{"observed_at":"2026-08-01T16:57:10.969687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:11.025440Z","title":"Dysarthric speech database for universal access research","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.025440Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:f516ad40a0c7578b72a14707d1eb6dd48c99317832aed9827a14def3325f14dc","observation_id":"71d50e5a-808b-4942-b232-ae969f19b093","resolution":{"observed_at":"2026-08-01T16:57:11.025440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-15T09:10:38.316635Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08194","snapshot_observed_at":"2026-08-01T16:57:11.090454Z","title":"Globeaudio: A multilingual multicultural bench- mark for naturalistic evaluation of large audio-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.090454Z"},"links":{"cited_paper":"/paper/2606.08194","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:7bc42b69ac0b79bf5bde7fcb4e30b68f142edade61809c1b02c51469fece7e95","observation_id":"d41c04b3-9982-42b5-84da-2e50ea5883cf","resolution":{"observed_at":"2026-08-01T16:57:11.090454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:11.222090Z","title":"Fleurs-slu: A massively multilingual benchmark for spoken language understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.222090Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:1c36c5aa75d3e87be4897cdfc7a0502ddab1c16046ee8e41212ca62b47ae8f87","observation_id":"11dbac94-4904-40d3-acf6-50a735a500ab","resolution":{"observed_at":"2026-08-01T16:57:11.222090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:11.301886Z","title":"Iberobench: A benchmark for llm evaluation in iberian languages,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.301886Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:452c3463b9ecb6b6f204d5e1edf720cc2b7e7e7be5f3a9ea8129d4e65a059b7f","observation_id":"ffcd3afb-a461-4cd5-a34a-cda8081f76f7","resolution":{"observed_at":"2026-08-01T16:57:11.301886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02782","last_updated":"2026-08-18T18:37:58Z","snapshot_observed_at":"2026-08-22T06:09:39.537795Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02782","snapshot_observed_at":"2026-08-01T16:57:11.349967Z","title":"When audio-language models fail to leverage mul- timodal context for dysarthric speech recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.349967Z"},"links":{"cited_paper":"/paper/2605.02782","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:da1a18f952fae7805fb63de3c2ea5359c7ec1254bae5ea3dd81cb07918932758","observation_id":"475bb423-9c3c-4c9b-aff9-f39783c5f9f6","resolution":{"observed_at":"2026-08-01T16:57:11.349967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00688","snapshot_observed_at":"2026-08-01T16:57:11.412058Z","title":"Omnivoice: Towards omnilingual zero-shot text-to-speech with diffusion language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.412058Z"},"links":{"cited_paper":"/paper/2604.00688","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:77f5e7ddd0688f84cfc6b5b7220bec1415ae43910561932db3ddd4ba1dba4c46","observation_id":"9cc5e804-cf13-49d7-a5bf-9a56f198001d","resolution":{"observed_at":"2026-08-01T16:57:11.412058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T16:57:11.564423Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.564423Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:0b918e3bc68711a63182abda400994cf63a46a9814881f2676b7e07f0c19ab19","observation_id":"9ccec7c0-c125-411f-809c-446281cc4a93","resolution":{"observed_at":"2026-08-01T16:57:11.564423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:57:11.619856Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.619856Z"},"links":{"citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:2f4688593f3fa959ffdb18b11cc06bd30f7b9ef3043a3a17496721550d2e108f","observation_id":"c4382f2f-1055-420e-bb10-d92b3463db70","resolution":{"observed_at":"2026-08-01T16:57:11.619856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T16:57:11.668450Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.668450Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:f468326049e69f718a9518607733fa0916ce7d6cb9679c4435f65a1d6cf3af1d","observation_id":"b1ec11eb-0e8b-409f-8c0d-7ea12fb291bb","resolution":{"observed_at":"2026-08-01T16:57:11.668450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.17812."}