{"as_of":"2026-08-18T11:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe848008b6037a0566c19387231ff2f6c1b0ad24c2b68760747601483f2850dd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:30:50.848560Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T06:06:41.523281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":"2401.07333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ELLA-V: stable neural codec language modeling with alignment-guided sequence reordering.CoRR, abs/2401.07333","venue":null,"work_id":"7f191ce6-d219-44dd-a589-0460faf88454","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:e4bfd2674fe1276cece612b9330870d919f8df358061845870c88c84a2112e8a","observation_id":"d0f75a98-3c8f-4f61-8936-a580fe1f5d83","resolution":{"observed_at":"2026-05-16T06:06:41.525280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-12T04:46:23.337892Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-17T12:38:34.413744Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.337892Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:64ce44a6463db61fa86b338403a0a69db2ad39b0154d9a56dd600f31ebdf0b56","observation_id":"52a4f702-c67b-4136-bb99-3b2fed255e00","resolution":{"observed_at":"2026-08-12T04:46:23.337892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-11T19:32:24.101443Z","title":"In Conference of the International Speech Communication Association, pages 2756–2760","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06602","last_updated":"2025-08-25T07:30:54Z","snapshot_observed_at":"2026-08-11T19:26:50.636660Z","submitted_at":"2024-12-09T15:50:25Z","title":"Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T19:32:24.101443Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2412.06602"},"observation_digest":"sha256:d16924863cd981e49659039f93873cfaaf3640934ea92711f75f8b7288c77c9a","observation_id":"b0ae0045-a581-40fc-a133-ecb6925a0a34","resolution":{"observed_at":"2026-08-11T19:32:24.101443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":"2401.07333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ELLA-V: stable neural codec language modeling with alignment-guided sequence reordering.CoRR, abs/2401.07333","venue":null,"work_id":"7f191ce6-d219-44dd-a589-0460faf88454","year":2024},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:814b672bd49b7bcd70c827195a496134ff9e5a872cbe39ae13c063d800c1951a","observation_id":"51354e05-5798-4e18-8382-4f2524b82618","resolution":{"observed_at":"2026-05-13T06:19:09.538142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-10T21:10:55.757511Z","title":"ELLA-V: Stable neural codec language modeling with alignment-guided sequence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05787","last_updated":"2025-01-10T08:41:42Z","snapshot_observed_at":"2026-08-13T18:31:51.429324Z","submitted_at":"2025-01-10T08:41:42Z","title":"MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:55.757511Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2501.05787"},"observation_digest":"sha256:89a6bbebc4fb468491fcd59e10c7ca98fc6c98278c5658e141aab8e868c17981","observation_id":"11998235-261a-4a26-84fc-ee303e461380","resolution":{"observed_at":"2026-08-10T21:10:55.757511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-10T20:34:37.652047Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08238","last_updated":"2026-06-05T17:32:46Z","snapshot_observed_at":"2026-08-17T22:34:27.630404Z","submitted_at":"2025-01-14T16:26:14Z","title":"CodecFake+: Codec-Based Resynthesized Data as a Proxy for Detecting CodecFake Speech","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:37.652047Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2501.08238"},"observation_digest":"sha256:fa417d337a98d4ffe9ebeea072506fe2644fd450ed932c3aee1d07fc54d11980","observation_id":"13d7ca2a-2279-434b-8f66-9cf72fd94b38","resolution":{"observed_at":"2026-08-10T20:34:37.652047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-08T21:54:08.485720Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05236","last_updated":"2025-07-22T21:32:13Z","snapshot_observed_at":"2026-08-16T02:03:06.649495Z","submitted_at":"2025-02-07T06:47:11Z","title":"Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T21:54:08.485720Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2502.05236"},"observation_digest":"sha256:f7281c64ccbe541e026af426c823948347dc0504973c4ea48844fcae330ad66d","observation_id":"f1241b30-69e3-4f52-90d6-97ee7d2b37d4","resolution":{"observed_at":"2026-08-08T21:54:08.485720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-15T20:30:50.848560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12800","last_updated":"2025-05-19T07:31:55Z","snapshot_observed_at":"2026-08-17T12:38:34.601646Z","submitted_at":"2025-05-19T07:31:55Z","title":"OZSpeech: One-step Zero-shot Speech Synthesis with Learned-Prior-Conditioned Flow Matching","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:30:50.848560Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.12800"},"observation_digest":"sha256:523f4925b2229e21ce7ad3631dbd0c01c537ae2b7fe4a3013cb76914ab80bc77","observation_id":"78a7e2c6-acca-45c8-adee-6b6c05fad01a","resolution":{"observed_at":"2026-08-15T20:30:50.848560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":"2401.07333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ELLA-V: stable neural codec language modeling with alignment-guided sequence reordering.CoRR, abs/2401.07333","venue":null,"work_id":"7f191ce6-d219-44dd-a589-0460faf88454","year":2024},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:a391b3d7ae5e048a543d43ca0b8b3cff6393968f5e9c9aebd16ce943384f2218","observation_id":"2824899f-324d-4976-ad1f-b2f429daa910","resolution":{"observed_at":"2026-05-16T05:27:25.474301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-07T14:15:56.310389Z","title":"ELLA-V: Sta- ble neural codec language modeling with alignment-guided se- quence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.310389Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:587fab2b38600ff4f290e0a4e4f831f8f2316a17751faab477ac1e92d5a7a376","observation_id":"b835ee00-fb8d-4e72-8092-748c120d4af8","resolution":{"observed_at":"2026-08-07T14:15:56.310389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-07T12:27:29.295374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-15T08:11:51.259191Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.295374Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:9057bbbd5646f86c2077c4f7945f356c7c500ae6f7ae707cb3a2e05bcd2a3e21","observation_id":"88b84e91-c007-4a5d-9186-1ade72b1f353","resolution":{"observed_at":"2026-08-07T12:27:29.295374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-04T18:51:21.098815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09631","last_updated":"2026-06-17T16:16:04Z","snapshot_observed_at":"2026-08-14T21:04:21.790164Z","submitted_at":"2025-09-11T17:16:52Z","title":"DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T18:51:21.098815Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2509.09631"},"observation_digest":"sha256:29aa5e6896e3d62eb9634c7a91ff6b07cc37089ec2939a824aa0ced063006539","observation_id":"d9ad5e0b-6bdc-447e-a44f-faaf8d83c312","resolution":{"observed_at":"2026-08-04T18:51:21.098815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.07333/citation-record","integrity":"/paper/2401.07333/integrity","json":"/paper/2401.07333/citation-record.json","paper":"/paper/2401.07333"},"outbound":[],"paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:27:37.650753Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2401.07333."}