{"as_of":"2026-08-21T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45f4ed1f3947be02b7404aa320528ebb1a4b4ba55d68b02713f391f7af78b469","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:16:17.331703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:08:37.504398Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-12T11:41:45.432669Z","title":"Simple- speech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17998","last_updated":"2024-11-27T02:31:52Z","snapshot_observed_at":"2026-08-19T00:30:02.078194Z","submitted_at":"2024-11-27T02:31:52Z","title":"Speech Separation using Neural Audio Codecs with Embedding Loss","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:41:45.432669Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2411.17998"},"observation_digest":"sha256:3683be16440b086cc92fa1063f1cf0950c377e3d82af3405a7747b7ad3fa1d60","observation_id":"e0a27129-931a-4f22-92d5-d9946d014e29","resolution":{"observed_at":"2026-08-12T11:41:45.432669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-15T22:16:17.331703Z","title":"Sim- plespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models.arXiv preprint arXiv:2406.02328,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-19T00:25:29.376635Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:16:17.331703Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2505.07916"},"observation_digest":"sha256:14a1a3e817cc84e9fd2575415b067d374a0f53e0a1dedab6373fed38b8f9c93e","observation_id":"07ee884e-10a3-469e-a0a5-68388c88c031","resolution":{"observed_at":"2026-08-15T22:16:17.331703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-07T12:12:56.625844Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-17T20:27:27.274767Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.625844Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:148b2d5ead5bbd6f8bea31bd6d66b06622214b1b0bf31bd1555d3fedad81a3e4","observation_id":"cb511548-a040-4418-975d-3dd8512cc73a","resolution":{"observed_at":"2026-08-07T12:12:56.625844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T23:21:59.444748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-16T15:06:17.970180Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.444748Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:26b87fa3309fc1c3044bb84968453cac973e766b2704e9577277254690576956","observation_id":"3532d1ea-3948-4fe4-a0b4-111f73970903","resolution":{"observed_at":"2026-08-06T23:21:59.444748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T11:34:09.476364Z","title":"Sim- plespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-14T20:29:00.417184Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.476364Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:c04c3e8fd3e476a630046513d2615c2e457db222ec289296df7b5932bc8d57ad","observation_id":"9cb08e55-b39c-4f59-ab51-4d28892893d5","resolution":{"observed_at":"2026-08-06T11:34:09.476364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-02T21:11:51.164939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-16T06:41:42.720292Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:51.164939Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:b4feb4c570aa930e90797837a89d9a04e2057605302fd107cc26c76dbd2ef76c","observation_id":"b78d2d07-028f-4631-9aff-1f837a23dda8","resolution":{"observed_at":"2026-08-02T21:11:51.164939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-07-03T16:08:37.504398Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models","venue":null,"work_id":"8de4dfc4-a957-4a9b-8fdd-2810c0d53640","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-19T16:10:35.180348Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2d91751c39458a637e5a7a7f3730cf6f07b23fe192ac3b27b99b9df2edf30fe9","observation_id":"ea9e05b2-2663-4396-bd66-7eaa480045e2","resolution":{"observed_at":"2026-05-11T08:30:57.175358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-07-03T16:08:37.504398Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models","venue":null,"work_id":"8de4dfc4-a957-4a9b-8fdd-2810c0d53640","year":2024},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-08-13T18:47:34.345492Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:3d48a40b37116de9b3ebea267354ca4a3b3f6d7d3011757a0255c1f1039111c8","observation_id":"5645eff3-53d7-43e8-8aae-52110c772c1a","resolution":{"observed_at":"2026-07-03T16:08:37.506013Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-07-03T16:08:37.504398Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models","venue":null,"work_id":"8de4dfc4-a957-4a9b-8fdd-2810c0d53640","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:03f3e7ea76b4b5b66d5a74936c7e77511912d0f248dd6907848e6808be1eb7c9","observation_id":"6ca38534-66b4-4f39-af00-cc40940c04a9","resolution":{"observed_at":"2026-07-01T11:45:47.163389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.02328/citation-record","integrity":"/paper/2406.02328/integrity","json":"/paper/2406.02328/citation-record.json","paper":"/paper/2406.02328"},"outbound":[],"paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T00:29:49.697017Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2406.02328."}