{"as_of":"2026-08-18T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f78e4903f5b3f878a3c1f1f120a470f5dbbaa8876e39db01334f509629665d09","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:33:14.493016Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:18:55.435027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-08-11T22:10:01.080802Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:9453e2cacf1b4b327194e4429b9d5462195f5eb1e86543cca5003eb216868ce2","observation_id":"662da643-4ff2-4908-b0df-431df5ff5a86","resolution":{"observed_at":"2026-05-18T18:11:43.160420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:e00f9c1bad0e8c2eff185438c95e5af3746dc15d7a30e03aeb0462cef3669eab","observation_id":"1cd5ced8-1692-4beb-8b08-f654536cbb5a","resolution":{"observed_at":"2026-05-18T16:31:37.256969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2510.00626","last_updated":"2026-04-26T15:50:39Z","snapshot_observed_at":"2026-08-14T23:23:23.386557Z","submitted_at":"2025-10-01T07:59:45Z","title":"When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T11:08:08.916893Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2510.00626"},"observation_digest":"sha256:951e2d24b3d33fc76b52bb8b6c774796ac9028baddf32c95309284da2f1839a7","observation_id":"a0e3317c-5ce5-44cf-9647-e5ce27401e88","resolution":{"observed_at":"2026-05-18T11:11:17.928697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2512.01512","last_updated":"2026-04-13T14:21:57Z","snapshot_observed_at":"2026-08-11T13:20:07.730722Z","submitted_at":"2025-12-01T10:39:12Z","title":"MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T03:15:04.685150Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2512.01512"},"observation_digest":"sha256:c805d2f253223f1f1435ba6d4a17900866ec61cbfa8fb2301c374846c799017e","observation_id":"0f6ce27a-0879-40da-ba58-40b297daf860","resolution":{"observed_at":"2026-05-17T03:18:57.194337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2512.16378","last_updated":"2026-04-25T20:42:51Z","snapshot_observed_at":"2026-08-15T09:09:05.619478Z","submitted_at":"2025-12-18T10:21:14Z","title":"Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T21:49:21.785096Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2512.16378"},"observation_digest":"sha256:e506ef5047fbca0eb35b070431ecdb55fb0f89affb085b0dcfbc6277cf9e3ba2","observation_id":"aedec695-5e30-49da-8b5f-1e495ca7d192","resolution":{"observed_at":"2026-05-16T21:51:17.744592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-03T12:02:01.060858Z","title":"H., Ehrenberg, A., Lo, A., Denoix, C., Barreau, C., Lample, G., Delignon, J.-M., Chandu, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-15T17:09:58.548655Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:01.060858Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:464715e52b202cdfa0324547f2bddf769e9f699819f01a8c61766e2f470c496c","observation_id":"6f2c17ec-f531-4595-844d-f988b6c02138","resolution":{"observed_at":"2026-08-03T12:02:01.060858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2601.09270","last_updated":"2026-04-13T14:09:14Z","snapshot_observed_at":"2026-08-17T21:04:34.413654Z","submitted_at":"2026-01-14T08:05:16Z","title":"MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T14:30:46.664861Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2601.09270"},"observation_digest":"sha256:f4f9c9649e1341737f3ab212646e1ddf21708ef504bd01f64fa170ad19b223cf","observation_id":"7fee6458-3f1a-4934-a8fb-d11077dcf17f","resolution":{"observed_at":"2026-05-16T14:31:01.948157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-03T01:17:47.177241Z","title":"org/CorpusID:266933314","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10230","last_updated":"2026-07-22T23:43:02Z","snapshot_observed_at":"2026-08-15T19:24:52.326672Z","submitted_at":"2026-02-10T19:19:52Z","title":"Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:47.177241Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2602.10230"},"observation_digest":"sha256:3827efc5778c66e1d5fdcff651511c4738ad3a96b4ddfd7826b9570c701ebc50","observation_id":"6f18f1dd-31ad-4a52-824c-bc3794f08c4b","resolution":{"observed_at":"2026-08-03T01:17:47.177241Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2602.11298","last_updated":"2026-04-06T15:18:26Z","snapshot_observed_at":"2026-08-12T18:59:47.656993Z","submitted_at":"2026-02-11T19:17:10Z","title":"Voxtral Realtime","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T02:12:16.230433Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2602.11298"},"observation_digest":"sha256:6a289396583594b1383317bbb7d52ed2328902b9a3fa81dcf0edc17e0a11b32b","observation_id":"ead7a03c-a489-4e31-909e-3f4ffdf8286e","resolution":{"observed_at":"2026-05-16T02:17:07.534451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-15T13:58:09.323985Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06193","last_updated":"2026-06-22T08:34:44Z","snapshot_observed_at":"2026-08-13T02:50:40.384002Z","submitted_at":"2026-03-06T12:04:12Z","title":"Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T13:58:09.323985Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2603.06193"},"observation_digest":"sha256:2892570308d92d74ac867714ae2ab698939dd259144a18f67bbe9ffb7a8d49df","observation_id":"30e63df0-e21b-49e6-987d-3d7423224a24","resolution":{"observed_at":"2026-07-15T13:58:09.323985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:5f13eb0c4130bd4e9fd2aded6249937ded59af5b8122c51139d26237eb11adc7","observation_id":"1ed46d8e-0b15-47c3-a503-5d2f63050ffb","resolution":{"observed_at":"2026-05-15T00:39:35.904186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.03995","last_updated":"2026-04-05T06:32:08Z","snapshot_observed_at":"2026-08-11T14:42:12.766450Z","submitted_at":"2026-04-05T06:32:08Z","title":"A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T17:34:10.089555Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.03995"},"observation_digest":"sha256:22ce0085cce3d9b7e475f7edfd44d385ce583ad8440525cb4be6a1e788bab409","observation_id":"5ce1c60b-9d74-46cb-a146-1d958d5f5268","resolution":{"observed_at":"2026-05-13T17:38:02.912734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.08003","last_updated":"2026-04-09T09:07:52Z","snapshot_observed_at":"2026-08-15T12:24:31.594968Z","submitted_at":"2026-04-09T09:07:52Z","title":"Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:50.408402Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.08003"},"observation_digest":"sha256:d2ccb7d61c439a8a0bca00c804ca36765369e7e88f587983c730aff06d73361a","observation_id":"ee50c181-d1bb-48e4-8ade-7d783804a987","resolution":{"observed_at":"2026-05-11T05:30:57.273062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.14493","last_updated":"2026-04-19T17:58:49Z","snapshot_observed_at":"2026-08-12T00:45:25.228383Z","submitted_at":"2026-04-16T00:04:32Z","title":"Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:04:25.418910Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.14493"},"observation_digest":"sha256:5305c3445f2097e15fc0f3cf08486dd3e73fb546e1ab17845766d4d790b092e8","observation_id":"80077c05-c593-4017-a3fc-d8b955e24824","resolution":{"observed_at":"2026-05-10T12:05:21.947631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:52869ec20d0d77e2aff04fd7adee859a0357f29e9cc292b8d551288b422d4807","observation_id":"90b0e157-88b6-4957-bf2c-41ebed10af62","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-11T08:37:21.535936Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:9db5d889d0d7326c8267bbafa91cc5a2260facc57db316c1555d81374969d50f","observation_id":"fd193cf0-bba9-4e8f-8dc3-90a2dbfc38af","resolution":{"observed_at":"2026-05-10T11:35:18.928382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.18105","last_updated":"2026-06-18T09:00:08Z","snapshot_observed_at":"2026-08-12T20:55:59.091609Z","submitted_at":"2026-04-20T11:21:06Z","title":"NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T03:48:14.211240Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.18105"},"observation_digest":"sha256:c05d62687885e0f6678a49b02679e2f4168784ccdaf210223fa7b832bd378efa","observation_id":"b62a8db8-b7fa-4358-8b82-bd05cd3a6147","resolution":{"observed_at":"2026-05-11T12:21:05.956205Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.18105","last_updated":"2026-06-18T09:00:08Z","snapshot_observed_at":"2026-08-12T20:55:59.091609Z","submitted_at":"2026-04-20T11:21:06Z","title":"NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-05T13:15:50.794969Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.18105"},"observation_digest":"sha256:c26ec392ffbf555cf906d5a53989a7f5204e549bb73b8b7f35fd6507f483628f","observation_id":"eb5755be-f0df-4074-9c12-38e2410bcec6","resolution":{"observed_at":"2026-07-05T13:21:06.288305Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.19565","last_updated":"2026-04-21T15:18:10Z","snapshot_observed_at":"2026-08-16T04:12:12.313160Z","submitted_at":"2026-04-21T15:18:10Z","title":"Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T01:56:44.270045Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.19565"},"observation_digest":"sha256:df8290078e90d3b8750a860de9e502f902ee8dc1201f3ac4c2fba870c7516106","observation_id":"256912e3-6864-4baf-9ea3-8de8e581005e","resolution":{"observed_at":"2026-05-11T13:21:04.863844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-08-15T03:10:55.387410Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:b34482649bbc282c0988c9431ea5ced0f9cca914497a9057784b332a59d04c0c","observation_id":"4b0de199-c1d6-4d80-96d5-4d692b1707f5","resolution":{"observed_at":"2026-05-11T23:16:36.207134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-11T04:21:44.774351Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:c87dba97449aa2c15f94a0b74ec659e78c5ae3c0896c5e3dcd6f0f827f60aacf","observation_id":"cddb048c-95c5-4ca8-89b1-7f2772e7c382","resolution":{"observed_at":"2026-05-12T00:46:12.313110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2605.17370","last_updated":"2026-05-19T04:10:37Z","snapshot_observed_at":"2026-08-15T05:29:59.111546Z","submitted_at":"2026-05-17T10:27:52Z","title":"CBT-Audio: Evaluating Audio Language Models for Patient-Side Distress Intensity Estimation in CBT Session Recordings","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T13:25:09.024054Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2605.17370"},"observation_digest":"sha256:52c8f285a442dde8b8e070fd3d0e8e892e7a05a9d1f51a13e0f098fa0fe28f03","observation_id":"60e21894-abda-4684-9f83-0ce4229d7933","resolution":{"observed_at":"2026-05-20T13:28:19.127591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2605.20414","last_updated":"2026-05-25T03:05:12Z","snapshot_observed_at":"2026-08-17T01:47:26.106095Z","submitted_at":"2026-05-19T19:10:30Z","title":"PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:56:38.345335Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2605.20414"},"observation_digest":"sha256:289661424d8a9c4ed119a1cb275bf457ffe3da5b4b2b8a30815f0293856a7f65","observation_id":"d3e0dafa-6f9e-4827-918a-b1b55040a066","resolution":{"observed_at":"2026-06-30T18:04:58.390433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.00168","last_updated":"2026-05-29T12:40:16Z","snapshot_observed_at":"2026-08-15T01:50:08.163854Z","submitted_at":"2026-05-29T12:40:16Z","title":"RealityTest: How People Probe AI Identity and Whether Models Disclose It","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:22:43.432328Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.00168"},"observation_digest":"sha256:e31e6cfce46bfee0ea32a45aed4fc841178c8ab5ed707c848e67fe767a8234d7","observation_id":"d0f92b36-1701-424a-996a-d33d1a2d8f79","resolution":{"observed_at":"2026-07-01T19:36:08.724825Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.01483","last_updated":"2026-05-31T22:54:57Z","snapshot_observed_at":"2026-08-14T06:27:31.699966Z","submitted_at":"2026-05-31T22:54:57Z","title":"MURMUR: An Efficient Inference System for Long-Form ASR","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T17:06:02.978205Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.01483"},"observation_digest":"sha256:4553ffd9fa4e094ca6568a20ce52278a355a71395a3527506f476e0055366e6b","observation_id":"bbdcde03-ba1e-4cec-ae6b-f9221912c4b9","resolution":{"observed_at":"2026-06-28T17:12:25.096494Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.03241","last_updated":"2026-06-02T07:01:33Z","snapshot_observed_at":"2026-08-06T18:58:23.488249Z","submitted_at":"2026-06-02T07:01:33Z","title":"Benchmarking Speech-to-Speech Translation Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T10:34:10.510906Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.03241"},"observation_digest":"sha256:b4652c8bb8e9f1692ede0ccdaa915869a29826f02e973c233abcb3894a60bdd6","observation_id":"7584a4a5-0da4-48d6-8531-a78848bbc4cc","resolution":{"observed_at":"2026-07-02T02:46:29.444473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.06037","last_updated":"2026-06-08T08:49:38Z","snapshot_observed_at":"2026-08-16T00:54:20.080229Z","submitted_at":"2026-06-04T11:31:38Z","title":"SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T23:44:42.188662Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.06037"},"observation_digest":"sha256:1eccf58d68fb332001a24219a06cd9c4636ae16b3808f7427af3d964ea9a4a1a","observation_id":"a0d2211e-f890-4faf-950f-365b3c96cbf4","resolution":{"observed_at":"2026-07-02T15:37:06.724970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.06177","last_updated":"2026-06-04T13:52:21Z","snapshot_observed_at":"2026-08-15T08:45:40.826105Z","submitted_at":"2026-06-04T13:52:21Z","title":"Ouvia: A User-centered Framework for Measuring Usability of Speech Translation in Real-World Communication Scenarios","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T01:11:56.037674Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.06177"},"observation_digest":"sha256:fd7060490c6683d1cc55ebfbee361dedbad2ca8dae469272c6b7e715a72a44e1","observation_id":"aafcd460-72a7-47fd-8edf-415cf5d7ba2e","resolution":{"observed_at":"2026-07-02T13:36:59.045645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.06211","last_updated":"2026-06-04T14:20:11Z","snapshot_observed_at":"2026-08-13T17:09:06.204366Z","submitted_at":"2026-06-04T14:20:11Z","title":"FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T01:58:13.871771Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.06211"},"observation_digest":"sha256:770935a66e38eb9a202f281596de25bd7592a868d99ff74912e7e938617fc653","observation_id":"d44d6b97-d702-4272-b6db-bac2e0c8b265","resolution":{"observed_at":"2026-07-02T12:36:57.087582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-15T09:10:38.316635Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T19:51:59.265579Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.08194"},"observation_digest":"sha256:cd54a1c4acc0c5f9f6ac99fde81e7a69bee14fed3082772a26207d0ee9ed8e7c","observation_id":"b6a6fc55-6346-4ddd-a7b6-aaa034707fd8","resolution":{"observed_at":"2026-07-02T21:17:24.526077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.09335","last_updated":"2026-06-08T11:03:25Z","snapshot_observed_at":"2026-08-07T05:59:53.128999Z","submitted_at":"2026-06-08T11:03:25Z","title":"Factors affecting ASR performance: A study using state of the art ASR models in Indic Languages","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T15:10:03.282212Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.09335"},"observation_digest":"sha256:d7fef697ff6009a5544870e974959d8c3d07a614413252d438e22fd4acb74880","observation_id":"1dd1ca22-5f05-4303-a152-1a539f8dad00","resolution":{"observed_at":"2026-07-03T03:37:35.489322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.13464","last_updated":"2026-06-11T15:18:32Z","snapshot_observed_at":"2026-08-13T22:57:44.384755Z","submitted_at":"2026-06-11T15:18:32Z","title":"Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T07:06:13.658919Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.13464"},"observation_digest":"sha256:54276940c29352c2db9e91d65ff615b9b062c56bb51a24b2955a9ff3ad5939a6","observation_id":"e1e30ead-2568-4317-951a-3ec879112b81","resolution":{"observed_at":"2026-06-27T07:10:41.472377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.14784","last_updated":"2026-06-18T08:18:44Z","snapshot_observed_at":"2026-08-05T01:39:54.477253Z","submitted_at":"2026-06-10T11:08:21Z","title":"LLM-Based Synthetic Ground Truth Generation for Audio-Based Emotion Classification via In-Context Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T08:13:38.489672Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.14784"},"observation_digest":"sha256:73486efb9e7775c8bc29e44d7a2aa6ab0c103ae883aa65fde896fb857d0b08c2","observation_id":"6725bc1e-3f7f-4e9a-9927-0a6805a368f8","resolution":{"observed_at":"2026-07-03T13:18:13.111737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.18134","last_updated":"2026-06-16T16:34:35Z","snapshot_observed_at":"2026-08-12T19:00:31.560743Z","submitted_at":"2026-06-16T16:34:35Z","title":"Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T22:39:09.967750Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.18134"},"observation_digest":"sha256:ad738881409cbebb98d09f75117854a3ce1957e1de713d2c6c0633cbc3afbd20","observation_id":"40abd6fa-fb90-4d9c-aa60-a7a9a732fbf9","resolution":{"observed_at":"2026-07-03T23:19:03.351616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.19157","last_updated":"2026-06-24T04:32:31Z","snapshot_observed_at":"2026-07-06T23:54:27.624372Z","submitted_at":"2026-06-17T14:59:37Z","title":"IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T19:14:26.452851Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.19157"},"observation_digest":"sha256:027495a82d7a095b9e93d3c595b96f2430a36dad78edeab970fbddba93fb1427","observation_id":"d77aea3a-6b1f-445a-a6fd-03536a02d0bc","resolution":{"observed_at":"2026-07-04T02:49:24.345552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.21408","last_updated":"2026-06-19T13:20:16Z","snapshot_observed_at":"2026-08-15T12:12:46.886951Z","submitted_at":"2026-06-19T13:20:16Z","title":"Vaani Benchmark V1.0: An Inclusive Multimodal Benchmark Dataset for Hindi","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T13:07:37.187581Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.21408"},"observation_digest":"sha256:ac3156bbb052a92d3b86df1bec2e28336f5e6c968cdd8fc6bc6d8de4507420ea","observation_id":"bf1f3ad5-679f-4774-ab11-7bdcb3f241b0","resolution":{"observed_at":"2026-07-04T07:39:39.279437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.25391","last_updated":"2026-06-24T04:42:57Z","snapshot_observed_at":"2026-08-17T07:35:57.198246Z","submitted_at":"2026-06-24T04:42:57Z","title":"From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-25T20:36:24.901454Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.25391"},"observation_digest":"sha256:627da4368ef9af3c674661b49a50006c9296b2b57cda660a089d4a6d135bc909","observation_id":"d8fea7a4-5eef-4f8c-8b54-d05aaf81e144","resolution":{"observed_at":"2026-07-04T20:10:07.978640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-08-14T12:28:23.502257Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:67b2ff168c914624161a9c35afd9b553683d5c4471d701c967fd7631a99d6b8a","observation_id":"d2974562-cdae-4ac4-9b9b-b750ba3a5404","resolution":{"observed_at":"2026-07-04T13:59:52.910091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.01733","last_updated":"2026-07-02T05:42:01Z","snapshot_observed_at":"2026-08-13T23:11:18.045524Z","submitted_at":"2026-07-02T05:42:01Z","title":"Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T15:17:52.966144Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.01733"},"observation_digest":"sha256:5e6f4ad25a9abae6b84e19dbe2b5b2d21b8cff677fd1fba9a3a3817ed65d3da8","observation_id":"fe7dcb65-5b71-4ae1-8988-2dca377b95f5","resolution":{"observed_at":"2026-07-03T15:18:32.663262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-12T04:08:13.798171Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03207","last_updated":"2026-07-03T11:23:43Z","snapshot_observed_at":"2026-08-17T22:51:21.293280Z","submitted_at":"2026-07-03T11:23:43Z","title":"S-DiverSe: Spanish Diverse Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T04:08:13.798171Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.03207"},"observation_digest":"sha256:6b486920ae60f866c903f8d3f0109f1f8038a767abc319c2f33e98ff477d37a0","observation_id":"58468181-dd03-488c-b1e6-6a5ecce3a2d3","resolution":{"observed_at":"2026-07-12T04:08:13.798171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-13T19:24:37.674798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:c4a529f0fcdcf930352dd24cd3381dde4f8c0faf8f42d6ccd7886f4a2430e5c1","observation_id":"16a04cd9-a983-4ec9-a239-ed53e31d7c02","resolution":{"observed_at":"2026-07-08T00:04:22.545770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2507.13264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-13T19:24:37.674798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:910a05c7cb8950b5d9bafe8a59b750c83b4f7898c0b507d902d0363b8102c554","observation_id":"f1cf07ff-4252-4e63-9d6d-39b3b03ac91f","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:78ec8f04a36f479142917489b6ea3627801e227ca17680358c25e60ab23320a0","observation_id":"3db9f10c-f72e-4a63-802f-e476e6864eec","resolution":{"observed_at":"2026-07-10T20:27:36.607654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-14T12:07:39.817307Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10387","last_updated":"2026-07-11T16:34:25Z","snapshot_observed_at":"2026-08-14T16:52:06.760735Z","submitted_at":"2026-07-11T16:34:25Z","title":"GigaChat Audio: Time-aware Large Audio Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:39.817307Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.10387"},"observation_digest":"sha256:9b91fe7ad4915e8352f479c47cff204729aa467ddecb13f5e877a38b992728c7","observation_id":"382579c1-70e4-4e99-9485-5309bbe4cacb","resolution":{"observed_at":"2026-07-14T12:07:39.817307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-02T05:20:01.370603Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-14T13:27:55.861429Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:20:01.370603Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:044e27e2a54a32bad2802d284512fd6cd2eb68d8b7eb40420a3bc25422d20259","observation_id":"608bbfa2-db29-48f0-b7a6-465c09ffa510","resolution":{"observed_at":"2026-08-02T05:20:01.370603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-02T05:08:03.719567Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-13T13:24:44.207473Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.719567Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:0d5a6f85bdae478b9cac46304257e798374d2258393454b3fce5b5a98c78e80a","observation_id":"eee421ae-6f81-4633-954c-6d145337df2e","resolution":{"observed_at":"2026-08-02T05:08:03.719567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T18:42:01.682549Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17230","last_updated":"2026-07-19T12:49:35Z","snapshot_observed_at":"2026-08-15T06:08:37.604856Z","submitted_at":"2026-07-19T12:49:35Z","title":"Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:42:01.682549Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.17230"},"observation_digest":"sha256:4dd78043e7f155c1c0ffc9c104cd1503b437ddf6ce382280fbdeb7334d898789","observation_id":"8e8acb12-a731-4957-b1d3-2163a6c723c3","resolution":{"observed_at":"2026-08-01T18:42:01.682549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T16:57:11.564423Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-13T17:52:06.911557Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.564423Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:0b918e3bc68711a63182abda400994cf63a46a9814881f2676b7e07f0c19ab19","observation_id":"9ccec7c0-c125-411f-809c-446281cc4a93","resolution":{"observed_at":"2026-08-01T16:57:11.564423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-01T07:12:17.795578Z","title":"arXiv preprint arXiv:2507.13264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":186,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.795578Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:6e3ca240ac1606c2bfdf57ed04584794c0fd1a2331837f641f77ca533f0a6ebb","observation_id":"f66feb1f-3887-4922-a1bb-388b081b4484","resolution":{"observed_at":"2026-08-01T07:12:17.795578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-08T11:50:21.284618Z","title":"arXiv preprint arXiv:2507.13264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-15T10:49:11.108765Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.284618Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0999b646011ba424a0a082e26908611e1dc9df2db1d23ec139f74ebc098e9e09","observation_id":"1a6436a5-9d86-4ce1-a02a-b3b484edd004","resolution":{"observed_at":"2026-08-08T11:50:21.284618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-16T04:18:55.435027Z","title":"and Ehrenberg, Andy and Lo, Andy and Denoix, Cl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12703","last_updated":"2026-08-13T01:34:38Z","snapshot_observed_at":"2026-08-18T09:58:52.733237Z","submitted_at":"2026-08-13T01:34:38Z","title":"Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:18:55.435027Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2608.12703"},"observation_digest":"sha256:27ad4c66fce56cf44c9333208f1f678c819f0cf230207c7f9b1c6842c4ee111c","observation_id":"0c3b5525-9e95-4a16-acdf-ccbc3b7bc1d4","resolution":{"observed_at":"2026-08-16T04:18:55.435027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13264/citation-record","integrity":"/paper/2507.13264/integrity","json":"/paper/2507.13264/citation-record.json","paper":"/paper/2507.13264"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:16.251616Z","title":"Numbers should be written in English words rather than Arabic or roman numerals","venue":null,"work_id":"d3ce90a8-5738-4bb6-b01b-a85758582a43","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.503404Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:42bae646eff34e4cdce484fccb08da53b6ce6b764bc0ea8ced8753ae0798b414","observation_id":"8a9fb8ba-1b53-4d07-954f-11600f7cb224","resolution":{"observed_at":"2026-08-06T16:33:16.306416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:16.178064Z","title":null,"venue":null,"work_id":"1f6acb7a-7e2a-4318-8a62-948ab93ce3ec","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.569506Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:7fd0cad25532ea9c158bb394bdb3fc751a04700bba231789027df9b36ea8c256","observation_id":"c7897d11-f762-442e-af86-a28e70170e55","resolution":{"observed_at":"2026-08-06T16:33:16.211766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:16.078835Z","title":null,"venue":null,"work_id":"58a938dc-3aa6-4ee0-a8ba-a92d32d160c4","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.596841Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:fbf6be061361991c8efef31466eb9bc8c3a4508b9ecb56af27d262a9d635c4f0","observation_id":"d55d5a29-c116-404b-86f4-ade90004e13d","resolution":{"observed_at":"2026-08-06T16:33:16.115400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.971160Z","title":"Only if the bullets start with alphabets, use corresponding alphabets like A, B, C, D or use Option A, Option B, Option C, Option D","venue":null,"work_id":"d74f1951-464f-4def-a426-03a35c080996","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.640166Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:a3dddf9acdb629ea3b86740c04163d1bb26319d8b387459cadf271289dc050f1","observation_id":"a57e3fd3-7048-4806-9ed5-3838dac06701","resolution":{"observed_at":"2026-08-06T16:33:16.025785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.912112Z","title":null,"venue":null,"work_id":"a5e5f9dd-de19-4f66-97b4-039757819b4c","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.694139Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:3a684387ede032b35830d17b5bb7723166526e237739a9d8bb186f26950b0785","observation_id":"03c75ec9-b932-4f30-ba1c-6cd6d98bf3b5","resolution":{"observed_at":"2026-08-06T16:33:15.928827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.787001Z","title":"For Eg: ’ffmpeg’ can be broken down to ’F F M P E G’, ’.bashrc’ can be broken down into ’dot bash R C’ or ’C++’ can be broken down into ’C plus plus’, ’IoT as I","venue":null,"work_id":"5091239b-d2bd-4a0b-8cd1-23b7323ff736","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.774751Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:3146e7161bc5b26596db7f19be2bc1fc11f71d97e85b494d01226f74b8ab0445","observation_id":"a199fcaa-e111-4cfd-b6e3-a41ac343b1b0","resolution":{"observed_at":"2026-08-06T16:33:15.852518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.678015Z","title":null,"venue":null,"work_id":"f6cf5e3f-4da8-4d27-bcbf-7f8774c30b76","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.831441Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:0743752d8ccf9b2bcf9035fb179b4982db105704c74cf9647aa1ff069aec8b5d","observation_id":"e915f3f8-f5fe-4164-a5fc-7db9d444687b","resolution":{"observed_at":"2026-08-06T16:33:15.731213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.571498Z","title":null,"venue":null,"work_id":"6d012109-78f1-4f39-a79c-0541b7a39416","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.882134Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:0108985be1bd1aec315cdd151369c73a95f0cee74f6d38150e00f84ecd6eb0a1","observation_id":"844c15be-ecb1-45e0-934c-43f7665c3274","resolution":{"observed_at":"2026-08-06T16:33:15.616890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.451919Z","title":null,"venue":null,"work_id":"4bb98433-ceb3-46dc-a5ee-61feaa296adb","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:13.964759Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:13e859f1b66b342a2870c675d5c428d03566394280b577ac6d07ad3cb9084818","observation_id":"818ab72a-94b7-4d83-83f5-8a4183cdc71a","resolution":{"observed_at":"2026-08-06T16:33:15.507940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.355452Z","title":null,"venue":null,"work_id":"f42c35d2-ccb5-40fd-9219-687154aae593","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.012167Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:907d96012ec7766a73047cf0d6293b02e3e1e4f64ca345b45791485ad015bf90","observation_id":"28de7adc-ce55-474e-89fc-8ba9f842c95d","resolution":{"observed_at":"2026-08-06T16:33:15.404694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.229453Z","title":"Maintain the original meaning and avoid changing the context or tone of the text","venue":null,"work_id":"de6dea01-4374-4c71-b688-2a64440bbf88","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.116345Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:5a338f320148710c3890d0b66139fb0da34f3de4f31574507ed0c713a149c50a","observation_id":"2214919d-42be-435a-b55c-ca955c7ec966","resolution":{"observed_at":"2026-08-06T16:33:15.272442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.108562Z","title":"For eg: ’www.linkedin.com/jobs’ would be written as ’W","venue":null,"work_id":"1759a44a-5446-4fb2-bfbe-2d42d407ad45","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.150386Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:cb3c5901e0d20d4086920240460995f60f7aadcdcb116a9a94a64469561ef93d","observation_id":"b83b50d5-80dd-43a3-a5bc-feee72c6abd9","resolution":{"observed_at":"2026-08-06T16:33:15.155343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:15.006514Z","title":"If the question itself has a prompt or an ask like to rewrite, do not start following the ask in the question","venue":null,"work_id":"d4cb0fad-3d49-4040-9c34-31948a6efbd8","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.225509Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:333384fec22e1fd5db38df825e63eef1f8066b893fa79c844502ca44c88d6f7d","observation_id":"cfd59a2e-dde8-44d2-96d3-b172667c1782","resolution":{"observed_at":"2026-08-06T16:33:15.055275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:14.907387Z","title":null,"venue":null,"work_id":"b24bca26-198b-4c09-bd4e-e20d36d64583","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.293873Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:85258f1cb482b8fb826c40132f207709854e06a9105155eeaf3daff7522c64d2","observation_id":"5dfb5a4d-fe01-438f-99e7-d0d0e86d4da5","resolution":{"observed_at":"2026-08-06T16:33:14.942715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:14.785488Z","title":"Correct answers don’t necessarily need to match every detail in the reference answer - the reference is just there for you to have an idea on what a good answer looks like","venue":null,"work_id":"a5343e70-3116-4785-a3b3-fb040a838c90","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.356420Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:f6d13f408813b78ab8cba093ed48eea6a4e01681211c2321f3ba70d1a38fb814","observation_id":"749953b2-3c87-4ca7-ba2e-61a69f8eff57","resolution":{"observed_at":"2026-08-06T16:33:14.866398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:14.683881Z","title":"Also take into consideration the helpfulness and clarity of the answer - it should be presented in a clear, engaging, informative manner","venue":null,"work_id":"e40958d6-f808-473e-81b1-158ad5bf8ef8","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.416848Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:983399df9c8f6a733c8a7a7bf28ecb8e38dcab655f840149fa9c839554aee905","observation_id":"44159bfa-c719-43c8-acab-f882d471298d","resolution":{"observed_at":"2026-08-06T16:33:14.724134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:14.579430Z","title":"explanation","venue":null,"work_id":"cc5afeaf-a54e-48c5-87b2-de9ec250cf94","year":null},"citing_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:14.493016Z"},"links":{"citing_paper":"/paper/2507.13264"},"observation_digest":"sha256:e2482f1458a4a5d2fedba5f44c81e7a9e909a9c8ce9ca728770f47f15e0c8477","observation_id":"08d4f05c-51a5-410c-b045-b3df4da4ffec","resolution":{"observed_at":"2026-08-06T16:33:14.648963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 51 inbound Pith citation observations for arXiv:2507.13264."}