{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18dd78502b3e273392bdc26e797225a5e81a01d3d4e1f8d2424399f8513c7a3e","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:02:03.077732Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:36:31.523597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:19:02.942476Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-08-03T06:36:31.523597Z","title":"Tts-1 technical report.arXiv preprint arXiv:2507.21138,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-05T03:41:49.406487Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.523597Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:0fbf0e597d795be166e61a2cebaffbe05e32ce6a94d9920f406111ed961aa0f8","observation_id":"64fed19a-4d58-49a6-867f-8977988efecd","resolution":{"observed_at":"2026-08-03T06:36:31.523597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.21138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-07-03T23:19:02.942476Z","title":null,"venue":null,"work_id":"9970cc99-21e4-4754-93ab-32211b152974","year":2025},"citing_paper":{"arxiv_id":"2604.27607","last_updated":"2026-05-07T10:41:55Z","snapshot_observed_at":"2026-08-04T02:43:28.238788Z","submitted_at":"2026-04-30T08:59:03Z","title":"JaiTTS: A Thai Voice Cloning Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-07T06:34:45.357695Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2604.27607"},"observation_digest":"sha256:4fc3ee4620093ba65bb02fecc2b512f0d4fbf0bab679238ea40d527ff57ab4bf","observation_id":"b76085d3-b265-4c38-beb9-aa07f37b5812","resolution":{"observed_at":"2026-05-12T10:21:28.850669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.21138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-07-03T23:19:02.942476Z","title":null,"venue":null,"work_id":"9970cc99-21e4-4754-93ab-32211b152974","year":2025},"citing_paper":{"arxiv_id":"2604.27607","last_updated":"2026-05-07T10:41:55Z","snapshot_observed_at":"2026-08-04T02:43:28.238788Z","submitted_at":"2026-04-30T08:59:03Z","title":"JaiTTS: A Thai Voice Cloning Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T03:09:24.541657Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2604.27607"},"observation_digest":"sha256:5da936eece604f0bb4e1839ee0a9d8d0b31064c94dd435eaf0e74b5cc5f13ce9","observation_id":"cca52b6c-b63b-414c-9517-cb5c8bc46c2a","resolution":{"observed_at":"2026-05-11T22:16:26.706638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.21138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-07-03T23:19:02.942476Z","title":null,"venue":null,"work_id":"9970cc99-21e4-4754-93ab-32211b152974","year":2025},"citing_paper":{"arxiv_id":"2606.18323","last_updated":"2026-06-16T15:41:44Z","snapshot_observed_at":"2026-08-06T02:49:06.057401Z","submitted_at":"2026-06-16T15:41:44Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T22:46:47.786929Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2606.18323"},"observation_digest":"sha256:a0cc78ed70856b741380ad70c1e344ec1cf7596f7080035d2bbf0042bc4b03be","observation_id":"cc3f5c45-0029-4f23-a0c6-f49bfa10d585","resolution":{"observed_at":"2026-07-03T23:19:02.945574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21138/citation-record","integrity":"/paper/2507.21138/integrity","json":"/paper/2507.21138/citation-record.json","paper":"/paper/2507.21138"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T15:02:02.830714Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.830714Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:6153e9304904aff520729d2293b2bf7cf7ac1cd88d5c7cf39301015cf45aa0c2","observation_id":"1116d9ff-1bb6-45fe-8c3b-2d690506a98d","resolution":{"observed_at":"2026-08-06T15:02:02.830714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.053088Z","title":"Yodas: Youtube-oriented dataset for audio and speech","venue":null,"work_id":"d1749849-d565-4027-88d4-a2704aa29075","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.837634Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2bc87e50fe6f726b5b9420ac09427413cfa509e7783be7287e9da14c13e55bd4","observation_id":"b6165c63-f5b3-490c-908c-7f7aa6a4e881","resolution":{"observed_at":"2026-08-06T15:02:04.059235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.035830Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"bd375b7d-1170-4423-92ef-2b8c590866dd","year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.843161Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:f76cedb6f7919331ef707e2d1f7b0ccb370d61f1233d69246cd75c48eac6581d","observation_id":"9a8e03bc-ef3b-494a-8385-5600549cb4dc","resolution":{"observed_at":"2026-08-06T15:02:04.040769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.020387Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models","venue":null,"work_id":"f14311f5-fdef-44b2-bffa-eaa4b67a7585","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.847985Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:cbcf87aaf6e1aea1be8d6453d45ac0c650ee356afd504fbbb08c05f1d1b744ff","observation_id":"a5392520-ba95-430c-a8b1-d442e5564146","resolution":{"observed_at":"2026-08-06T15:02:04.025179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:04.002310Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":"2d921ab7-8c22-4405-a2ce-37c5c901bb71","year":2019},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.854081Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2a59933257b304501187024ae2458b25ac4b842348e0c009d3f25220f34f0b0c","observation_id":"d993e778-bc6a-4974-a47b-8ab4e75e5f8b","resolution":{"observed_at":"2026-08-06T15:02:04.008207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T15:02:02.858858Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.858858Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7daca12625f686bcd636876831ad39473a8216e3b0767bcf33f4fe61700a8828","observation_id":"448ecfc7-dea8-42b5-b8e6-c5ee136542be","resolution":{"observed_at":"2026-08-06T15:02:02.858858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.982157Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"35fc0556-114f-46d8-a8ad-90007def35a5","year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.865173Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:3fb6bd1d45213222c60c381caa120528e3402fa7a502f2784b080ecb3f74a26d","observation_id":"e9573b28-862d-43f8-928b-4878a58d2629","resolution":{"observed_at":"2026-08-06T15:02:03.988145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.958810Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"3adabe5e-77b9-40b2-b4d2-d5787b0e4985","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.870328Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2cafca0bdd9180a4612e2e510242938a0bbaa8240f79d10eb2bd4d4b5ed3f3ba","observation_id":"e204a9e3-3816-48fe-84cf-4e4f73ff3a0c","resolution":{"observed_at":"2026-08-06T15:02:03.965541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.875785Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.875785Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:96b18fe1d429439a4f8deaae94fa63e44ca126e61d2e61d90f402cffa423fc28","observation_id":"3fb837f9-85f5-43b5-add2-e03a99597d36","resolution":{"observed_at":"2026-08-06T15:02:02.875785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T15:02:02.880909Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.880909Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:646c6c61ca450597dd32244599ddfec1511d7738b00272bdcd5ca995b758bad6","observation_id":"7c2d9832-c784-4272-b9a4-311689e7b0d2","resolution":{"observed_at":"2026-08-06T15:02:02.880909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:02:02.886470Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.886470Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:374cb3560ca879b621a32eaa7bdd651d2bbfd9e7075566d72f65ad17658e77b1","observation_id":"d96c6f96-d5ae-4aa6-b75b-63251abf5781","resolution":{"observed_at":"2026-08-06T15:02:02.886470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-07T15:47:51.144825Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-06T15:02:02.891456Z","title":"Minimax-speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.891456Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0731444f79f68b5940efb90a88b9cb51a86a25ccd8ed5cc67c2ea39f73eaf496","observation_id":"bc5e8aef-029b-4609-8889-5fef279eb141","resolution":{"observed_at":"2026-08-06T15:02:02.891456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T15:02:02.897698Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.897698Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0a1a4ac155c01de91d81711de271db78c5cc72e3c3a7abee64a79fb0aa828ec9","observation_id":"aed9d272-a437-42ff-bec8-c77046dd3603","resolution":{"observed_at":"2026-08-06T15:02:02.897698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T15:02:02.904024Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.904024Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:eedd70c8366b219284e938488a66a953564668a969cd28b80e591a110ed42c4f","observation_id":"a3c777f1-cd98-4493-aae4-b99d5ea637dd","resolution":{"observed_at":"2026-08-06T15:02:02.904024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T15:02:02.908687Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.908687Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7ff3e3e3cd4cfa05d4b502f989d871587a30288d71496d64b86ca829250016e6","observation_id":"a2cd3a78-d85f-44a1-9c4b-f1c80281eac1","resolution":{"observed_at":"2026-08-06T15:02:02.908687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.918911Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":"59526fef-00fe-4a91-9fef-2f02500b847f","year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.913946Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:f83c6aaf0adcf594143b9f3049bc5215759d41eeec1b685050514768eeb1b0bc","observation_id":"bd31abf3-cdc3-4957-9bde-e4ca9251251f","resolution":{"observed_at":"2026-08-06T15:02:03.926487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.898243Z","title":"Open instruction generalist (oig) dataset","venue":null,"work_id":"2d17ab72-2e0a-4e76-a441-508c2692deda","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.919362Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:a23ee80c5f522377d106bde3ae272845f3a1daf1cce903a678026bbf829eeee5","observation_id":"669d28f8-b554-4228-a0ee-fdb73850def1","resolution":{"observed_at":"2026-08-06T15:02:03.903451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:02:02.924574Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.924574Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:3d13023e2a33f24607d5488ebe6d07580b6f5e1269d26a54892e87f1b396f44f","observation_id":"1f6b538f-24df-4cef-b876-74eb4f3f71dc","resolution":{"observed_at":"2026-08-06T15:02:02.924574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T15:02:02.930108Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.930108Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:69c90959ce13ccba5947883ee7baafa65f9d3ea9bb4e1fdce5706ca43dfd3f68","observation_id":"5a853971-6149-46e6-9863-4098efe1267e","resolution":{"observed_at":"2026-08-06T15:02:02.930108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.878699Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"23caf953-16f2-4d2b-b300-c6aa33e64540","year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.935030Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:0484fa6ac68acd55e680176aad928b6b83aa55a2b589c57480e007f52f501da7","observation_id":"61e20d6f-5552-4c0c-a9a8-b4a2d805e76e","resolution":{"observed_at":"2026-08-06T15:02:03.884270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.860444Z","title":"Dnsmos p","venue":null,"work_id":"65214b12-41ce-4ab0-b955-b90d01231edf","year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.940134Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:fae97078c37c00a68261a0263ec283e6546a61dcd5dd15b6fa5cb44974b8c7c0","observation_id":"befd186d-6c49-493d-8b30-f788cea54faa","resolution":{"observed_at":"2026-08-06T15:02:03.865444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.944597Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.944597Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:ab2ae1291f185c7ef7f8e5bb9415dd1f8a9166a888b6e3110cdc0026c4d215d9","observation_id":"3d900436-35b3-4f17-b713-eba6b6f78fa3","resolution":{"observed_at":"2026-08-06T15:02:02.944597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.949788Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.949788Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:189aa12c639aa6d7803a093fa8f21dc1e7e07dd8959cf8235dff990d0c69416a","observation_id":"bdf5b87d-9598-4cab-88a2-5c88c38d010a","resolution":{"observed_at":"2026-08-06T15:02:02.949788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:02:02.954136Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.954136Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:fa4b06a2985576524506c6d0bc145754d1c7f937f8b766d5c87bb76301574651","observation_id":"089d6aab-8a5f-4074-bdbd-071b1dd9a10c","resolution":{"observed_at":"2026-08-06T15:02:02.954136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.819896Z","title":"Matrix multiplication background user’s guide","venue":null,"work_id":"08cfe823-9f35-4edc-8485-14ef0529890e","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.959872Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:d1fd3d4a832aaf78f89d3a63af85522b01a54426997f57c916d78df97be63ac2","observation_id":"6e452096-9f3d-4855-8a96-101daea28de3","resolution":{"observed_at":"2026-08-06T15:02:03.825369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.800541Z","title":"Initializing new word embeddings for pretrained language models","venue":null,"work_id":"92f0c606-dc75-4c0a-890f-078949ea652a","year":2021},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.964733Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7764058c357b0ae5428a3f4a4770282b468a2ce20573c70579338582c5212f68","observation_id":"63165417-09a3-4464-b43e-d01040b7e49f","resolution":{"observed_at":"2026-08-06T15:02:03.808174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-06T15:02:02.970136Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.970136Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:6aa670d2463f9fe933dd739a07b9865d62f38cb1ed801a5e7d756d39597ed958","observation_id":"dee61c16-a693-413d-baec-a8d71bc82094","resolution":{"observed_at":"2026-08-06T15:02:02.970136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.782568Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"1c655ea5-09af-41b2-a972-998f3d9b4ed3","year":2020},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.974412Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:76c367a1d1e3aaa6166a6cdfbc6800904f18acf91e2bc5bb1ea8cf2daa14ca67","observation_id":"e7372153-22da-4005-9a06-a28caf869736","resolution":{"observed_at":"2026-08-06T15:02:03.788491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T15:02:02.980832Z","title":"High fidelity neural audio compres- sion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.980832Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:ed40b63bec2e7abd4e3209501d048a73139fa99abfc3741363e397c55069e459","observation_id":"331a3e81-ee3b-4418-9bf2-aac95671b668","resolution":{"observed_at":"2026-08-06T15:02:02.980832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07388","last_updated":"2023-02-14T23:00:42Z","snapshot_observed_at":"2026-08-07T23:59:43.974546Z","submitted_at":"2023-02-14T23:00:42Z","title":"Adding Instructions during Pretraining: Effective Way of Controlling Toxicity in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07388","snapshot_observed_at":"2026-08-06T15:02:02.985709Z","title":"Adding instruc- tions during pretraining: Effective way of controlling toxicity in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.985709Z"},"links":{"cited_paper":"/paper/2302.07388","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:3085ad426858185aab61d485b886544b230bb0fa415040668703652669bcf775","observation_id":"dfac856f-3877-4bf0-9bdb-d925ad897b44","resolution":{"observed_at":"2026-08-06T15:02:02.985709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:02.990541Z","title":"A neural probabilistic language model","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.990541Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:6b0a1139fe9a1f6c4afd12dbc11b4560fbc5e88995d96e8c650b9ac02264bf61","observation_id":"b2d0e952-b052-4dc2-8a25-3c9367e1cfe1","resolution":{"observed_at":"2026-08-06T15:02:02.990541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T15:02:02.997072Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.997072Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:12a26bbe8d549deb34f9fba011662d70977fa414f53bccae09d7d2285459279a","observation_id":"9133858a-f8b9-420b-8e82-19916efa00be","resolution":{"observed_at":"2026-08-06T15:02:02.997072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T15:02:03.001891Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.001891Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:53af3be25a5e5e3727421e80c0beca60e305396a60d25d997502f8b1d0acecc3","observation_id":"29c6c949-fa70-4f7c-8811-4deab52cb8f1","resolution":{"observed_at":"2026-08-06T15:02:03.001891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-06T15:02:03.006360Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.006360Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2f5f7b7227d4b4138097d701ec39e45454211a98b9a688e83321ea780fd6a125","observation_id":"dc53bb10-0b74-41a7-93a0-bac436025d36","resolution":{"observed_at":"2026-08-06T15:02:03.006360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-06T15:02:03.011140Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.011140Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:5a6690a2e24e6e5a4a88905051de438c242f91c2f0f8def45e7e3754d13e68e5","observation_id":"d962fbbe-3828-4961-9347-cf0e52fb0db0","resolution":{"observed_at":"2026-08-06T15:02:03.011140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.749862Z","title":"Parler-tts","venue":null,"work_id":"75cd84b5-7d47-4007-a2e2-5adbd5461c4c","year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.016065Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:b0f3777455be57983b89877ff73356f1b4d478952a0fdff10abc5e73ee65498f","observation_id":"e27dba3b-4a19-4c67-a1b4-2ed803652cb5","resolution":{"observed_at":"2026-08-06T15:02:03.755019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.732486Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"4c1103a0-443e-4513-9ff9-def22617607f","year":2020},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.021572Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7de3b8d76276783ab136e84c79472f4a3c769353b09708798971500109251d06","observation_id":"8a5c05da-c5d0-4796-bf6d-9303960c483b","resolution":{"observed_at":"2026-08-06T15:02:03.737535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-08T16:08:45.949013Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-06T15:02:03.026897Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.026897Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:5b34c2aea066be7bcba04f0d0275b5dc0cc18f8769275d0ce58dc4f484493103","observation_id":"52ded5a3-2265-49cd-b401-61758dbf0392","resolution":{"observed_at":"2026-08-06T15:02:03.026897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-09T11:16:05.714394Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T15:02:03.032073Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.032073Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:513e7dec9ade04fde08900d4c0deac01ac8aa3dc9253aa1d6ef4ab181aa1b92d","observation_id":"3640e72a-bbf6-47a0-89f5-b238dca3c766","resolution":{"observed_at":"2026-08-06T15:02:03.032073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T15:02:03.037268Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.037268Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:f920fbbde397e364d2db20b8a58bc1ff9c646ea9db21976c7789539a71a89923","observation_id":"4a88a8cd-6997-471a-8f21-bc960cf587e3","resolution":{"observed_at":"2026-08-06T15:02:03.037268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T15:02:03.042360Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.042360Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2786713c6e5603257b3188cf0726ae3b0436791e17f084f329f785cdcc1c15bb","observation_id":"63c76d66-c01b-4edd-9a8a-2caebbdb197f","resolution":{"observed_at":"2026-08-06T15:02:03.042360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.047248Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.047248Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:5512494d6d313ae811e438cbf439b90c3e73ac69195ad382e614aff3691fa6b1","observation_id":"4ca58588-1f1f-4943-8194-60f8dbc61c15","resolution":{"observed_at":"2026-08-06T15:02:03.047248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T15:02:03.052195Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.052195Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2de360ae8aa12f9e9334657f087c5da7fd22f64561c88ea41f4572f44b28eb3d","observation_id":"f720f069-b85f-48e8-afe8-ae422da1397e","resolution":{"observed_at":"2026-08-06T15:02:03.052195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.057567Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.057567Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:a2e04d5d671dfe89efccc885909c0c282c9358a7fefd8bdb36c94117a8736aa0","observation_id":"b9b904ce-8b94-46ad-9c3d-99590258e76e","resolution":{"observed_at":"2026-08-06T15:02:03.057567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T15:02:03.063141Z","title":"Huggingface’s transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.063141Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:09f310aacdba099e339b94b7992ca091024d89ddc834d930b52ea21a5819bc30","observation_id":"6d2518ba-0c5b-4908-ace2-7d94f7171699","resolution":{"observed_at":"2026-08-06T15:02:03.063141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-06T15:02:03.068483Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.068483Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:fc50d7db02d9b8e592c6463f76a2a993be2c4e6c9251b4b51cd8d556d0ec75f4","observation_id":"bd80dfc2-0d2c-400a-818f-ebd963c3eeab","resolution":{"observed_at":"2026-08-06T15:02:03.068483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.685955Z","title":"Pytorch lightning","venue":null,"work_id":"141d0e84-9e1e-4193-8397-774f1b8ebfe7","year":2019},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.073406Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:5d8a57857df04bdb4a20609ad6175969a59e359681a1939f8aa1c8483b59193d","observation_id":"a606eda4-cfd8-44ee-85bf-7b99585a2b9b","resolution":{"observed_at":"2026-08-06T15:02:03.690672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:02:03.667856Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"872d65f1-7a2c-46b1-a7a2-8e6d6f976a1b","year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.077732Z"},"links":{"citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:05694ff3f395b1f8e97208b9e5e902c52412dd1f51d648cf09478b4c14fc017c","observation_id":"c88b760d-9f09-4e4e-a31c-fb9f6ae7cc7b","resolution":{"observed_at":"2026-08-06T15:02:03.674403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2507.21138."}