{"as_of":"2026-08-09T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae389eea77d3931c62b92e58d4bdf9ae3e9a31a561977e8117410e148341304a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:03.314763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.442888Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:a5202eb77c312d575c8a5b19ead8802f5adbfd8fb602c517159d7684ab704495","observation_id":"c3e9db4e-2e37-4824-b626-ded906c5e4eb","resolution":{"observed_at":"2026-05-24T00:28:39.518355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:97dc76ba65caeeaf8ee82fcdf477a5d4e8dcb47b6f7914679569edb983138739","observation_id":"b77fe242-bbaf-4c88-81c2-4b7a7701dbcb","resolution":{"observed_at":"2026-05-16T06:06:41.542344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2411.17690","last_updated":"2026-04-20T17:56:40Z","snapshot_observed_at":"2026-08-02T10:11:40.015144Z","submitted_at":"2024-11-26T18:57:29Z","title":"Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T17:22:23.797551Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2411.17690"},"observation_digest":"sha256:44ebf8b82da405e87b8bc5374921b7cccd5b474af27c9c15d684068500036fa2","observation_id":"80f70929-f25f-419f-8682-d847b21bd568","resolution":{"observed_at":"2026-05-23T17:23:14.993539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T15:23:03.314763Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation // arXiv preprint arXiv:2305.16107","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.314763Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:0ec281c183f64dbfffdaa7983a364bf948a091b48bf07439205850e1cd992f7f","observation_id":"4f65ed92-a07d-4eba-b903-d475e502c3ad","resolution":{"observed_at":"2026-08-07T15:23:03.314763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T14:19:53.771128Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation.ArXiv, abs/2305.16107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.771128Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:96159a044cd849e310787829e70c534d9da5b144b573815af37e6a7ba195faf8","observation_id":"dc3048c9-080b-4860-b527-1fcdc0f87fc5","resolution":{"observed_at":"2026-08-07T14:19:53.771128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T12:31:37.177571Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24248","last_updated":"2025-05-30T06:12:52Z","snapshot_observed_at":"2026-08-08T04:48:33.525066Z","submitted_at":"2025-05-30T06:12:52Z","title":"Probing the Robustness Properties of Neural Speech Codecs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:31:37.177571Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.24248"},"observation_digest":"sha256:241b7cf1d75fa70158cc94d7f4a07c7e302ba7d64b988f9fd0ad99968a4966d4","observation_id":"d051f26a-f4d5-4dc1-a1a0-71add2d27203","resolution":{"observed_at":"2026-08-07T12:31:37.177571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T11:58:41.093509Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.093509Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:df1072fd5e9ce3150a34e012373ac9947b7ccf710c1b4f4d9c717b8609846351","observation_id":"4870119f-084f-4438-ab2b-8d42b446748a","resolution":{"observed_at":"2026-08-07T11:58:41.093509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-05T16:46:49.240587Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.240587Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:dc798e2e230662c3e128104780cffb05cc2869afe455e0794fca0c3a3c6e24a8","observation_id":"82e7c989-1115-41fd-9d0b-10bca00a2b5c","resolution":{"observed_at":"2026-08-05T16:46:49.240587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-05T12:08:08.995130Z","title":"arXiv preprint arXiv:2305.16107 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01900","last_updated":"2025-09-02T02:43:11Z","snapshot_observed_at":"2026-08-06T20:27:40.472115Z","submitted_at":"2025-09-02T02:43:11Z","title":"Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:08:08.995130Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2509.01900"},"observation_digest":"sha256:68e2d0114033d9c6d3012321e2134b1932b62402c93e2f1730c140765346e6a4","observation_id":"7f3ad701-dcea-4c3b-bad3-7a246672d405","resolution":{"observed_at":"2026-08-05T12:08:08.995130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-03T06:23:43.836552Z","title":"Viola: Unified codec lan- guage models for speech recognition, synthesis, and trans- lation.arXiv preprint arXiv:2305.16107,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02557","last_updated":"2026-05-29T23:48:47Z","snapshot_observed_at":"2026-08-06T12:17:33.602297Z","submitted_at":"2026-01-30T14:23:50Z","title":"The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:23:43.836552Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2602.02557"},"observation_digest":"sha256:ae9b8088a961ceaf5371dc3e308e5f3b1919870247735ef57d9877933d3ba4b0","observation_id":"1716ce80-123e-484e-a4f3-65e6dab0be23","resolution":{"observed_at":"2026-08-03T06:23:43.836552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-08-09T17:47:14.826853Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:23399ced62c1dc12be3c27353eb83d6e02bf505e3551ccbeb93843a70223fa70","observation_id":"50646c69-958c-472e-8e22-427f1a6c492d","resolution":{"observed_at":"2026-05-11T19:16:08.727845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-08-09T17:47:14.826853Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:aa1839b979354be1f331d1e06e524c7e3050204894a164e612c595af55a590e2","observation_id":"7080ea78-843c-43d7-8167-70a5797c4f18","resolution":{"observed_at":"2026-06-30T23:15:07.867939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:615883cf0930e2ec7e7486073e3f28d71e78bb5cd6721e3d44247e6ff3d88ace","observation_id":"982b8fe7-f2ce-4605-b23c-dcdaf6dfac20","resolution":{"observed_at":"2026-07-08T00:04:22.444307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2305.16107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:11970232552fa1788b5711a0cebc5724e4618f284297006212c435b4e6831809","observation_id":"095db85d-7326-4c44-b4e9-7aebdf04307b","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.16107/citation-record","integrity":"/paper/2305.16107/integrity","json":"/paper/2305.16107/citation-record.json","paper":"/paper/2305.16107"},"outbound":[],"paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2305.16107."}