{"as_of":"2026-08-09T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f7e5ce6e40e18ed8573d73f32809d3fc7c40c6a575e778540e089edc533eeee","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:20.716820Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:27:35.627140Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:68fcbc5597c8c850b1b7a66898b15d8e9da6d72868c0e6f6263a27ea5409b9ac","observation_id":"a37e1d39-7169-43b7-b78e-807172d6bac5","resolution":{"observed_at":"2026-05-16T06:06:41.440978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-07T14:09:20.716820Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.716820Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:630a98773f2c5735106f5df93e5faa66d548d87f7755486350ea3073b2b8af63","observation_id":"409fb9d5-cb23-48db-a668-1044ea7a94e1","resolution":{"observed_at":"2026-08-07T14:09:20.716820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:5e7f22e9b8d5de992a177980f74ccb187487968255561ca8ac3a6aafd9806265","observation_id":"cda5b317-bf10-4a5b-9491-bd3be58499d9","resolution":{"observed_at":"2026-05-11T01:36:53.326258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-06T15:48:23.922139Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-08T10:46:13.682261Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.922139Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:06f185d6ed8eef24b9f8346a7503fd0f6cb15424847a720d192cbf1b8eb471c8","observation_id":"9a8e6f38-969d-4cdd-bd82-df9d885b2315","resolution":{"observed_at":"2026-08-06T15:48:23.922139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-05T16:01:52.701539Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19098","last_updated":"2025-08-26T14:59:30Z","snapshot_observed_at":"2026-08-06T21:25:08.912503Z","submitted_at":"2025-08-26T14:59:30Z","title":"CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:52.701539Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2508.19098"},"observation_digest":"sha256:62915ea48f319c19dfddd73eac1ba73ded288dd1e4facc7b4836d211ad30f3d3","observation_id":"9fbfafa0-f539-453a-95f2-15b3161ffe4c","resolution":{"observed_at":"2026-08-05T16:01:52.701539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2604.07209","last_updated":"2026-04-13T13:03:18Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T15:31:22Z","title":"INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T19:08:56.588282Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2604.07209"},"observation_digest":"sha256:8f866a75d895105249a301128f40896c9eb6767b567fe958b4a9932d382dab8b","observation_id":"ad2d839b-f8e5-48f7-82d1-2b7dae1305fa","resolution":{"observed_at":"2026-05-10T23:25:53.301154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0ae12f2c53e3ae7ead4b557bb018e362fe9de03a8ec37d8e879f7d4b86ae9b52","observation_id":"49e4c55a-ae76-4246-988d-bf6b3d735819","resolution":{"observed_at":"2026-05-11T08:30:57.216098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:bfc6558ad31d1456f0a54c52a203374c97c8093067a449c8cef34080b079c6fe","observation_id":"5cc8b4ba-b737-4398-9219-3a8d3acb7bc2","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2604.24794","last_updated":"2026-04-25T23:17:26Z","snapshot_observed_at":"2026-07-06T23:10:47.277692Z","submitted_at":"2026-04-25T23:17:26Z","title":"V.O.I.C.E (Voice, Ownership, Identity, Control, Expression): Risk Taxonomy of Synthetic Voice Generation From Empirical Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T07:46:23.931059Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2604.24794"},"observation_digest":"sha256:537c32a6505ce721812a0da060e479578bc2ee8b76e3e30e27514931990cf1c9","observation_id":"742112f1-e411-4b25-99dd-9cc91516fdfb","resolution":{"observed_at":"2026-05-11T20:51:14.507047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:d12d1e2f45e3357e749674ab0f21d305e69826f9a71e6753a7f514c195551bcb","observation_id":"054760b5-1092-498f-a46d-067d866ca8d2","resolution":{"observed_at":"2026-05-20T14:53:23.224858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:9c0a64740339efc8ef31621d85caf0f793784e3cd1a0325d6fbc847a3fb41469","observation_id":"efba0c9f-6502-4976-9253-af1178854f41","resolution":{"observed_at":"2026-07-02T19:57:20.039783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:376b965e4de28f2840a9dc726c82cf1a9fea75c018333540a4e29f4db10b070b","observation_id":"6a57ac6d-c5ad-41e0-949a-4c268b81d625","resolution":{"observed_at":"2026-07-03T03:27:35.628751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2406.05551 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-08-07T15:40:45.553118Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:e8f67d2f83e42d044e5b2032edf0cd8ec8cad46116a3213f34844cb3281a6e46","observation_id":"888525bb-4f74-4615-9b35-cae730747879","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-03T08:35:52.386314Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:52.386314Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:b71f6796545edc41226c1c863c99525dbd1b512737b6d810197a5b09aa52874e","observation_id":"9da3a33a-10a0-4a4d-93d7-2e50bb0c1f16","resolution":{"observed_at":"2026-08-03T08:35:52.386314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.05551/citation-record","integrity":"/paper/2406.05551/integrity","json":"/paper/2406.05551/citation-record.json","paper":"/paper/2406.05551"},"outbound":[],"paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2406.05551."}