{"as_of":"2026-08-14T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cea64b9cb301fa30ad011af27e8052939de28adcf3d1ce5659c1f09fbbbb6610","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:18:22.911332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T19:47:19.722749Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"cited_work":{"arxiv_id":"2603.25551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25551","snapshot_observed_at":"2026-07-02T19:47:19.722749Z","title":"Voxtral TTS","venue":"cs.AI","work_id":"4f8a171d-a5a3-467a-aa23-07450bdb79f4","year":2026},"citing_paper":{"arxiv_id":"2605.20830","last_updated":"2026-05-20T07:21:36Z","snapshot_observed_at":"2026-08-14T12:16:23.131331Z","submitted_at":"2026-05-20T07:21:36Z","title":"Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T02:32:26.122526Z"},"links":{"cited_paper":"/paper/2603.25551","citing_paper":"/paper/2605.20830"},"observation_digest":"sha256:52283f318c539f91e8df0efe81a7aac1026e1180843861ddb27d6cbaa65334f1","observation_id":"a25acf22-ec9e-41c3-b622-2d1b39e2fb65","resolution":{"observed_at":"2026-05-21T02:33:55.495102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"cited_work":{"arxiv_id":"2603.25551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25551","snapshot_observed_at":"2026-07-02T19:47:19.722749Z","title":"Voxtral TTS","venue":"cs.AI","work_id":"4f8a171d-a5a3-467a-aa23-07450bdb79f4","year":2026},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-14T07:09:25.386751Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2603.25551","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:5d97c826db273cf4521a1b202f6976b551801111b26c3ae24d825dd847bf2204","observation_id":"6051f762-2d09-4799-a60a-d30249337f90","resolution":{"observed_at":"2026-07-02T19:47:19.724003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.25551/citation-record","integrity":"/paper/2603.25551/integrity","json":"/paper/2603.25551/citation-record.json","paper":"/paper/2603.25551"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:6ed5d9b1538591966bf6cb2194766a6066f034811348d016f1ff63a8d592a99d","observation_id":"2e099125-5d51-42d8-9179-f8b163ee6863","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1566.2024","doi":"10.1109/slt61566.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chao, W.-H","venue":null,"work_id":"f8225990-05b1-4f2b-b5f3-7a926ca28d6e","year":2024},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:1d4fad6da7cf19f75047fd9dd5f37a7fc118a30372cd7e618b4c3284d049cd98","observation_id":"93308bf7-4b84-480f-88b4-8949f5fdbb8a","resolution":{"observed_at":"2026-05-15T00:39:35.572678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.328840","doi":"10.1109/taslp.2023.3288409","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing doi:10.1109/TASLP.2023.3288409","venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"5d7a3278-672f-4f7f-8ed8-a6c99bf69621","year":2023},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:b692615b46cb727e42af05e36f64c513e4361d733dc0e622cc6026d83b096ecd","observation_id":"e5aa4e0a-d80a-4e22-ac8b-8a9a02fcc81c","resolution":{"observed_at":"2026-05-15T00:39:35.576135Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:55.452963+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:55.452963+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:a5d0fb6a60a8f243340fb52091d04706e0d07aa0edf1b97962bb0cf04428cb18","observation_id":"009e605d-86d5-48b8-90b3-39a3e07fa395","resolution":{"observed_at":"2026-05-15T00:39:35.889040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:89316e8031258948450180b0b27d0a50f1ba3a10020828ded78911290bbad066","observation_id":"8b662cfa-d9e5-4c14-bfb7-c231a98b59ec","resolution":{"observed_at":"2026-05-15T00:39:35.893639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":"2387c0e0-789b-4596-863f-cda687e7a892","year":2020},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:f6f93ee7264d4bce67ce8cb48c84c9a658d3765af5c9951bda3bc85352c021c4","observation_id":"33eec127-4b32-4e78-be6d-f7889fb1f727","resolution":{"observed_at":"2026-05-15T00:39:36.281758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:0153260158563aedeff78573dbcbfb8ebcc308abb56da4f09c9c4e426fcfca3b","observation_id":"a2ea90cb-c396-4a88-ac44-bda34d8268de","resolution":{"observed_at":"2026-05-15T00:39:35.561776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:46cbac1c18380deda0056db59e9aa259333383ae22678de90dbb6a6e294c9abf","observation_id":"fe942684-64d2-445d-8bd2-16a0564a019f","resolution":{"observed_at":"2026-05-15T00:39:35.889997Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:ed36191d59c926c0a457dfc7f199300d83a0299e164e1c51ebd55a6b07dbcf3a","observation_id":"f3f11dd4-4422-4421-82ab-e01f5fd3a5a2","resolution":{"observed_at":"2026-05-15T00:39:35.565964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alexander H Liu, Sung-Lin Yeh, and James R Glass","venue":null,"work_id":"968defc0-e18b-410e-ab17-266c67197dd5","year":2023},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:f67e5c43d14ef20397e96d0ab6b69cee1b5f5532fe4efbcbea7497ede5d2d78b","observation_id":"b181bd6f-437d-4329-a365-cbee707a207d","resolution":{"observed_at":"2026-05-15T00:39:36.279560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:f299ed1be4048fd2d617bb071c37b5b34717f2c8efb300ec3f524f1bd815bc19","observation_id":"1ed46d8e-0b15-47c3-a503-5d2f63050ffb","resolution":{"observed_at":"2026-05-15T00:39:35.904186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-13T10:37:03.795815Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":"2308.05725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-07-03T14:38:28.620667Z","title":"[TARGET]","venue":null,"work_id":"0ae887a4-964c-4515-8a7e-7e4fc1e07dd1","year":2026},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:639a1833ae62bce6bd05ad213780a70f7788e3689bb5872968a4007bbb955cf1","observation_id":"d8ea44ac-40cb-4828-8173-552871608972","resolution":{"observed_at":"2026-05-15T00:39:35.896911Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-08-13T15:53:14.922964Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":"2411.19842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-07-03T16:08:37.492499Z","title":"Parker, Anton Smirnov, Jordi Pons, C","venue":null,"work_id":"0c3aa2ab-d1b6-4e28-88aa-ce62205ed208","year":2024},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:2864e562d43b9ceec41b4e1c4c6bd6e551804930a643fe2187e87a08c2c46618","observation_id":"ec8e546d-e712-4730-9e1f-5c7fb70d555c","resolution":{"observed_at":"2026-05-15T00:39:35.910557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":"2108.12409","doi":"10.48550/arxiv.2108.12409","metadata_source":"pith","pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":"cs.CL","work_id":"145b1374-5258-4c00-a433-4db0f5a50749","year":2021},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:815c97cd83974b37046f56d0b47aaff0a2084b98bc7b2048fc3da794c2bbfc20","observation_id":"b16f17ab-2d64-4dd7-b86e-2efe76bc2476","resolution":{"observed_at":"2026-05-15T00:39:35.906928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:38adc649dcd5956a22660c5aaae7c4a672f717d89b17f02396cc6d98b24f4ce7","observation_id":"33657dbe-719b-47bd-b6b8-78e3e3089ee3","resolution":{"observed_at":"2026-05-15T00:39:35.899779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.462363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.462363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02384","last_updated":"2024-09-04T02:20:59Z","snapshot_observed_at":"2026-08-12T22:51:52.585761Z","submitted_at":"2024-09-04T02:20:59Z","title":"STAB: Speech Tokenizer Assessment Benchmark","version":1},"cited_work":{"arxiv_id":"2409.02384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02384","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stab: Speech tokenizer assessment benchmark.arXiv preprint arXiv:2409.02384","venue":null,"work_id":"2f6cd2bc-ffdc-4703-a401-3d0d5ed8fa3c","year":null},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2409.02384","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:0ccfb39984a98e9c5be61e47e87d774c701bc6dcb2b9ab6227c9d94630228774","observation_id":"e003bb2c-f50a-4ffc-bc02-cab6c35ad609","resolution":{"observed_at":"2026-05-15T00:39:35.914011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:e1efb79fa80c5c55bb0df5a304d70b3f104f26c0fb73a6a170534375ff3678fc","observation_id":"59891d00-1594-4f9d-ba16-054ea3478155","resolution":{"observed_at":"2026-05-15T00:39:35.900889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:07.015791Z","title":"vllm-omni: Fully disaggregated serving for any-to-any multimodal models","venue":null,"work_id":"11eb1840-40c6-4f3c-8f6a-53422545f9d8","year":2026},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:8b3534a7037f6b29590b08c236c2c00293e70ffe053bcd2d0818c2bef35bfc30","observation_id":"1577ae56-63b0-4d02-a211-014364a9fed7","resolution":{"observed_at":"2026-05-15T00:39:35.892375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-07T15:47:51.144825Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":"2505.07916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-07-04T02:49:24.877685Z","title":"Minimax- speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":"54273fa8-90e2-4bbd-8703-905eed26289f","year":2025},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:0504d94628db08e4d1b1a5fc1544769fabbf5a103a9be23d006e570cdb0dbfef","observation_id":"0337724a-9c59-481c-9ea8-1557a43548e9","resolution":{"observed_at":"2026-05-15T00:39:35.876040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T00:14:04.727610Z","title":"arXiv preprint arXiv:2512.10264 (2025) 4, 5, 6","venue":null,"work_id":"4502a665-f60f-4616-9c73-368b97d61cf0","year":2025},"citing_paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:42.441340Z"},"links":{"citing_paper":"/paper/2603.25551"},"observation_digest":"sha256:8a3e016513ec60f4092e4e4d8e228668d1cada817a3eee48f4e952b220cdb7c8","observation_id":"cec73bd5-6426-4c71-9705-fc42a7a5ad2c","resolution":{"observed_at":"2026-05-15T00:39:35.872905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.25551","last_updated":"2026-04-06T15:20:14Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T13:12:48.531325Z","submitted_at":"2026-03-26T15:23:34Z","title":"Voxtral TTS"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":2},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2603.25551."}