{"as_of":"2026-08-18T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eeca0786716c0611b5e842465fa72ffee2446470598f8d23c623a6319c772aca","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:53.153699Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:45.554040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T17:26:22.148036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00324","snapshot_observed_at":"2026-08-06T21:23:45.554040Z","title":"We can broadly clas- sify these datasets into two categories, based on their speaker characteristics and intended applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.554040Z"},"links":{"cited_paper":"/paper/2507.00324","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:dde78a0b4c9596816ca3e8d5a02b5eac43e22a5a6a78722dfafac6e7030481b3","observation_id":"f6badd89-b359-41b2-abf5-00ce9b129525","resolution":{"observed_at":"2026-08-06T21:23:45.554040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"cited_work":{"arxiv_id":"2507.00324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00324","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collecting, curating, and annotating good quality speech deepfake dataset for famous figures: Process and challenges","venue":null,"work_id":"9866764e-0b44-453c-8608-d076043ecb87","year":2025},"citing_paper":{"arxiv_id":"2603.01482","last_updated":"2026-03-02T05:45:55Z","snapshot_observed_at":"2026-07-06T22:47:28.681790Z","submitted_at":"2026-03-02T05:45:55Z","title":"A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T17:25:27.137423Z"},"links":{"cited_paper":"/paper/2507.00324","citing_paper":"/paper/2603.01482"},"observation_digest":"sha256:f13f34d2acf959c33e9a726f7b8d66aeb8bc05ce6b96ad69c6a222157d12e3b9","observation_id":"aa481225-ba01-4ef9-86ae-5445907a2a84","resolution":{"observed_at":"2026-05-15T17:26:22.151421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00324/citation-record","integrity":"/paper/2507.00324/integrity","json":"/paper/2507.00324/citation-record.json","paper":"/paper/2507.00324"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:59.073986Z","title":"This high quality of synthesized speech and the ability to distribute it through so- cial media platforms are giving rise to manipulated information in the digital ecosystem","venue":null,"work_id":"ef84e0d3-159a-4e33-9320-b23aec9de42a","year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.377493Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:958b8f024cd323fc5a5d23aca67a8ca80fd3ceb44fa8ceae071e6001c024ef08","observation_id":"ec41e0e6-1bdb-490c-9c9d-924a5e4a3f48","resolution":{"observed_at":"2026-08-06T21:23:59.161684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00324","snapshot_observed_at":"2026-08-06T21:23:45.554040Z","title":"We can broadly clas- sify these datasets into two categories, based on their speaker characteristics and intended applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.554040Z"},"links":{"cited_paper":"/paper/2507.00324","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:dde78a0b4c9596816ca3e8d5a02b5eac43e22a5a6a78722dfafac6e7030481b3","observation_id":"f6badd89-b359-41b2-abf5-00ce9b129525","resolution":{"observed_at":"2026-08-06T21:23:45.554040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.690707Z","title":null,"venue":null,"work_id":"8e0839a7-3e86-4245-8e03-8961774f3f94","year":2018},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.820734Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d4abd98dba3359b42458fc36a99a6461fb6a66b3ffe74b5284e45ce3d119e282","observation_id":"34a76118-16bc-4390-b374-e4e12431aa93","resolution":{"observed_at":"2026-08-06T21:23:58.763526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.060164Z","title":null,"venue":null,"work_id":"2c9abf46-2e2b-49bf-b721-c5f35b4b6f07","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.517361Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d5b318d263a8a36e653403bd545b5df689b47db0078a43b6f3dc4e890defbad1","observation_id":"ef2e435e-1bf9-447f-b5bf-7d23e788857f","resolution":{"observed_at":"2026-08-06T21:23:58.124999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.508637Z","title":"It uses ffmpeg to download the best audio available in the W A V format, and resample it 16 kHz","venue":null,"work_id":"17eed0bb-7eac-4dd1-8ee6-47357a01c5bb","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.966902Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:99934b78c554920f3a8f4fefa1432f618de9123248a0c36d76d90c59b2e8bebb","observation_id":"0cb07594-6495-4010-8f5f-3ddfbfd46961","resolution":{"observed_at":"2026-08-06T21:23:58.593590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.354663Z","title":"This step eliminates cross-talk and background speakers","venue":null,"work_id":"86c4a6fd-067b-4155-a820-3c165a6d8fdd","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.148015Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:18acb88b3f670dd0711e0bad1a835fb190144e5354d91ba2db9c7777aa913d57","observation_id":"1b89340b-2c8d-421c-b373-261544e841bf","resolution":{"observed_at":"2026-08-06T21:23:58.415398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.219143Z","title":"We also experimented with the Google speech recognition api package and other commer- cial tools; however, they generated text with less accuracy and without proper punctuation","venue":null,"work_id":"0102a034-0bc5-4e47-8fcd-4baa1aaf2684","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.307871Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:c2dabec0f0cb5a39fdb3a974d012913a7b2f1d1f7c9c759f79e8a108afeb176f","observation_id":"538b5387-e11c-4005-ad38-1da8854d1d6d","resolution":{"observed_at":"2026-08-06T21:23:58.280280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.248442Z","title":"The Biden Deepfake Robocall Is Only the Beginning,","venue":null,"work_id":"c0ba0df7-55f1-4f87-9ed1-16d8b1eca2a7","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.600644Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:aa1332bc2493eae4d05580b42f1a862cc26dee83c4c02c7135ef8a5a5f0a9ac8","observation_id":"4c6b9b41-3a0c-48ba-b550-de8cd6d9fb70","resolution":{"observed_at":"2026-08-06T21:23:56.327407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.888719Z","title":null,"venue":null,"work_id":"066f6862-cefe-4d7d-9279-af1cf676c009","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.655038Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:546a6ef92b87a9627ac7583b597b2130804d3b1f2cf6a1512016457301d602ba","observation_id":"a2d27f96-3a9b-4336-98aa-fb4c88df9e0b","resolution":{"observed_at":"2026-08-06T21:23:57.977394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.702947Z","title":"Al- though early models produced robotic-sounding speech despite extensive training data, SSL-based methods significantly im- proved quality through large-scale pre-training","venue":null,"work_id":"9b7ad0a9-dc6f-4da8-b6d7-908e76c4a387","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.800698Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:6afdc8b0c3772cbe30082ddcc5fddb0af5239de438b0fdc1f7415b12fe41309f","observation_id":"4e2b14f0-ca40-4164-8436-31dbb8330c30","resolution":{"observed_at":"2026-08-06T21:23:57.786761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.536546Z","title":"We train StyleTTS2 [22] only using this approach","venue":null,"work_id":"3057551f-6c7c-48f7-a1f2-c21230d0c70d","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:46.967101Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:e9edd8dd3adcb9d7d8f358e4bace022dd091ef1423ee4d69641189d9c5b04a64","observation_id":"db3e056c-b005-4bf6-be5d-33f6bd23d504","resolution":{"observed_at":"2026-08-06T21:23:57.612401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.390940Z","title":null,"venue":null,"work_id":"7106578d-ea09-4e60-a0f5-4788b3a84c2d","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.155081Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:a910d95cb40740c8fe53b914bd27ae05056abaa7d82d8cbcb6d48fa1d0b43933","observation_id":"68170591-9c61-42c8-965d-3b9d503f8dbd","resolution":{"observed_at":"2026-08-06T21:23:57.454318Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.234936Z","title":"This approach preserved linguistic coherence and improved phoneme alignment, leading to reduced noise and more ac- curate spectrogram generation","venue":null,"work_id":"998797b7-7059-446a-8d03-5b20090dc509","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.266100Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:74d31a4f7dab7f0a4a3609d7bfe75effd11c47e80e5d7d8d39d9f142e9a323f0","observation_id":"d3b137ea-e398-49a9-8790-0dbbb28585d5","resolution":{"observed_at":"2026-08-06T21:23:57.305606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:57.099068Z","title":null,"venue":null,"work_id":"3a0d7e50-0059-429b-a825-138ce710b3d8","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.416615Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:9f5a864ee145a77d546f25834f3138289f0ba19c6ce40066f500c5ae52fa62ef","observation_id":"c11b0556-b91d-47d2-b848-ecabd713c468","resolution":{"observed_at":"2026-08-06T21:23:57.171255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.955827Z","title":"For subjective evaluation, we implemented a web-based listening test with 32 unique participants","venue":null,"work_id":"950b0069-6335-40fc-9eff-777d996393b2","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.567771Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:538f3331b462f60e6863497c549be5f50e4dbda31b9cfa572edfe812ce88c06f","observation_id":"7963db6e-35d6-4ed1-8b50-8ea095bc9efe","resolution":{"observed_at":"2026-08-06T21:23:57.026356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:58.888166Z","title":"Both datasets are derived from the VCTK corpus, which comprises high-quality speech recordings collected in a controlled laboratory environment","venue":null,"work_id":"e0949b05-871c-4d91-ac1c-90a0d521c946","year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:45.684201Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:eec5024d4f51141c141af854e087fe1490b98b15bba972ee6ff719ce95b88197","observation_id":"7c026615-d60c-4f4e-b76d-e32cb31a84dd","resolution":{"observed_at":"2026-08-06T21:23:58.981915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-16T18:13:35.460831Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T21:23:47.667605Z","title":"A survey on neural speech synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.667605Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:e5c9850e6311361d4b1b2ca3a78bb4b1e206b3fe8c3845c2d7629c11a8295aeb","observation_id":"b33136b0-dcd8-4c67-b4de-efbb7d05da97","resolution":{"observed_at":"2026-08-06T21:23:47.667605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T21:23:47.831204Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.831204Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:b92885b13251a8083f75c8f20a71094570cfc1cbca4377b4863891ca7225a9fb","observation_id":"8341b7aa-fa69-4608-9424-d0d851b6f797","resolution":{"observed_at":"2026-08-06T21:23:47.831204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:47.947919Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:47.947919Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:a244a36f7ecc601f9eacec7972e6ee29ce27567299fb267fda38ac4fc65fd0f6","observation_id":"42a44163-1117-4c28-a7f1-e42f8587f90f","resolution":{"observed_at":"2026-08-06T21:23:47.947919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T21:23:48.037703Z","title":"Neural codec language models are zero-shot text to speech synthesizers, 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.037703Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:ab8c00e33eab6ba60df8474a7737a08262589ec787f70e2acecbf7bb1ee2f701","observation_id":"013f9f70-da0e-40f7-ad16-7ecb4c6027bb","resolution":{"observed_at":"2026-08-06T21:23:48.037703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.782772Z","title":"Zse-vits: A zero-shot expressive voice cloning method based on vits,","venue":null,"work_id":"feeaf820-624e-4467-a0f5-8d6d2f113ae4","year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.196907Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:8f8b734946f4147ee1accc91679b8380f1e1755ea2f1a5478b5d29781cdebb7d","observation_id":"b4c32037-b3df-447c-a59e-bf9d1295845a","resolution":{"observed_at":"2026-08-06T21:23:56.862210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.623476Z","title":"Global Risks Report 2024","venue":null,"work_id":"afd24200-c52b-4d86-bb64-82e704934724","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.363816Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:4c567d8bcc94d2a6b08dd2ae4984524f3c6943e0de87ddcf3d0832b926f9b4d0","observation_id":"f633927c-eb74-431a-9d15-b2a2f1f499a7","resolution":{"observed_at":"2026-08-06T21:23:56.696718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.453972Z","title":"Russian War Report: Hacked news program and deep- fake video spread false Zelenskyy claims,","venue":null,"work_id":"92b29bbd-a588-471d-9563-d375ac987b7b","year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.508515Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:0c7da685f98a3d5edc7e6969f90e523562c12561fe435f15bc451f3911a4aad6","observation_id":"0646b28d-b632-4307-8403-ed1575d8c012","resolution":{"observed_at":"2026-08-06T21:23:56.520757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:56.075697Z","title":"Sadiq Khan says fake AI audio of him nearly led to serious disorder,","venue":null,"work_id":"3ff07cce-3562-4052-bdf9-c2913dac2658","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:48.786228Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:15ce12f483d59cd1b7b36959067222644e07ff0e75a787cd11872afeeaf6d517","observation_id":"e58cadbc-45e2-4815-8c6e-4857dd46ce3a","resolution":{"observed_at":"2026-08-06T21:23:56.151468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.886339Z","title":"Asvspoof 2019: A large-scale public database of synthe- sized, converted and replayed speech,","venue":null,"work_id":"3367e3b1-7355-4426-a142-d735958695c3","year":2019},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.011538Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:45c026a67fb581d0a90f87a9843cb8e3337c60f7814c429ce63b6b9fe7530b83","observation_id":"ec2c84af-dc38-4b29-94ad-3daabec6004d","resolution":{"observed_at":"2026-08-06T21:23:55.981769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1015516","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.184361Z","title":"ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild,","venue":null,"work_id":"633c486a-6bbe-4a4a-8c98-d53696b17cba","year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.236797Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:3c1a69bf30c35b6cca09f4472304784dcf40bdba150f2711ad654c9ad84ca2be","observation_id":"9881999c-8420-449f-ab10-23fe9167081d","resolution":{"observed_at":"2026-08-06T21:23:54.270034Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.722140Z","title":"Asvspoof 2021: accelerating progress in spoofed and deep- fake speech detection,","venue":null,"work_id":"327f3adc-7d94-47dd-a518-315806c0cbf9","year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.402291Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:babea272cd3f45a313efcd003f7f4b0c83fffc40ae2caedb9bb6db12f38fbf3a","observation_id":"6d8b812b-97c3-4995-af76-0fcc54dedc96","resolution":{"observed_at":"2026-08-06T21:23:55.809406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.517344Z","title":"Asvspoof 5: crowd- sourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":"54c1e501-ff4e-4648-92fa-b6c90e17cb9d","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.475227Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:c5614de29ca948f7b5c2239684b9ac5bcee85fb5310374200af2c096af853ff8","observation_id":"895e6283-bfc3-4fe6-a159-f39d9181dde1","resolution":{"observed_at":"2026-08-06T21:23:55.597029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-08-15T16:45:09.638988Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-06T21:23:49.572150Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.572150Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:3c126e84c4d28a24de2bfe479813c09cc342c5b681b0ba97a702cd6b2764976d","observation_id":"92954748-fe91-46f9-8a87-5e3657184c02","resolution":{"observed_at":"2026-08-06T21:23:49.572150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.364718Z","title":"Is audio spoof detection robust to laundering attacks?","venue":null,"work_id":"19a7b7dc-507b-4ce3-89e5-29173a63a8da","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.650417Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:bf5227a2a033f89f7934f8e8644a5a7a5710a1a1c50f9385d12767511ac2f692","observation_id":"c35826a2-ee87-426b-bcb1-1ba8811c9704","resolution":{"observed_at":"2026-08-06T21:23:55.425051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.230730Z","title":"Dfadd: The diffusion and flow- matching based audio deepfake dataset,","venue":null,"work_id":"e0c7c22e-c1f1-4a60-8a55-1641eb736d04","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.755413Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d97923f08e981054ebf429d9c9fa90fbc333e5e7269b231fe4fd422942f5f75e","observation_id":"98d7743b-a51d-4fd3-90cc-2ec3146a1361","resolution":{"observed_at":"2026-08-06T21:23:55.291982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04880","last_updated":"2024-12-25T07:30:50Z","snapshot_observed_at":"2026-08-16T13:54:25.621805Z","submitted_at":"2024-05-08T08:28:40Z","title":"The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio","version":3},"cited_work":{"arxiv_id":"2405.04880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.04880","snapshot_observed_at":"2026-08-06T21:23:53.845050Z","title":"The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio","venue":"cs.SD","work_id":"3509520c-a152-415d-959c-5e612d550e2d","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:49.860090Z"},"links":{"cited_paper":"/paper/2405.04880","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:0ee9fc8b4eb940f838e82282c46418fa41445d06e6d2f4781e9782b22743c9e7","observation_id":"202f6993-73f5-4b3c-8b6d-764782f87ef3","resolution":{"observed_at":"2026-08-06T21:23:53.920068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:55.066149Z","title":"Mlaad: The multi- language audio anti-spoofing dataset,","venue":null,"work_id":"cf6a9fe3-af58-457c-b072-c540a4faa3ec","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.027320Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:8ca8698cbd82f1cc5566f1fca668bfecad2b985e55e051565bb55d6685b13e51","observation_id":"59d04091-d3ea-4307-94a5-356266d1489a","resolution":{"observed_at":"2026-08-06T21:23:55.120571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.908119Z","title":"Does audio deepfake detection generalize?","venue":null,"work_id":"54cdb833-b3d1-4f53-815e-2a0b2f6712e1","year":2022},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.161862Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:3e22e727ee66f0ca30de80e21b194695e80d0972a7317a28f496f776ecc73083","observation_id":"016cbdbd-4287-4066-bc7e-543d76fab3e5","resolution":{"observed_at":"2026-08-06T21:23:54.952316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.729105Z","title":"Spoofceleb: Speech deepfake detection and sasv in the wild,","venue":null,"work_id":"db5dd55a-4d0a-433c-b7a6-b4a45f71eefb","year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.340067Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:b7370a43b12171b4076b76646a84c530bce0281d3b84e43656712e8b1c0a9efc","observation_id":"cd5d01b6-2b31-4925-a019-4ed5511686c0","resolution":{"observed_at":"2026-08-06T21:23:54.824184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:50.513280Z","title":"V oxceleb: Large-scale speaker verification in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.513280Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:524b7deb5e3219ba125f47e37b30043722d4daf56e89e9666624de0135fb9d06","observation_id":"285295d0-de4a-4fb1-8bc4-32d9917fa255","resolution":{"observed_at":"2026-08-06T21:23:50.513280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:50.723911Z","title":"Styletts 2: Towards human-level text-to-speech through style dif- fusion and adversarial training with large speech language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.723911Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:d39431577f32da5c49bdf2dd05144a12ab0ce0ce63b7b57f4b47dedd18f8fc4a","observation_id":"3d92ef0a-b118-4ee8-92f0-503f3c09a367","resolution":{"observed_at":"2026-08-06T21:23:50.723911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-17T16:41:56.671582Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-06T21:23:50.893642Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:50.893642Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:509eabf38e5aa0302cc7875cd6004a5e62bb268355aedb9b6ac40dbd9ae13328","observation_id":"6edb5495-89ea-4980-8374-716e9984d724","resolution":{"observed_at":"2026-08-06T21:23:50.893642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T21:23:51.063898Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.063898Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:5da44331f67eb2be43541aba519f15deff2f3f8ed2309739eddfdb7986bb86b2","observation_id":"a5447dd1-93e1-46c0-a6c2-e656c2f2e369","resolution":{"observed_at":"2026-08-06T21:23:51.063898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.589738Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":"29e1d4e8-a9e2-4462-bd61-e62c793f5368","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.260561Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:27b4f4cee46762bb4ed74f7459938aeda2f905e3c8e01e05c5a6b0e3ce8d2b50","observation_id":"298bbffc-0c0e-4256-9e0a-b1091923898c","resolution":{"observed_at":"2026-08-06T21:23:54.634215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-06T21:23:51.398868Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.398868Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:5fd11b7c8f098d37c3a1a85a4b2dac7baee7d8f998b8dce54b9144264260b794","observation_id":"be5a0f09-b588-4d3b-be6d-6f1fa0693359","resolution":{"observed_at":"2026-08-06T21:23:51.398868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07556","last_updated":"2025-01-02T03:07:29Z","snapshot_observed_at":"2026-08-16T13:19:21.283826Z","submitted_at":"2024-09-11T18:24:07Z","title":"SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis","version":2},"cited_work":{"arxiv_id":"2409.07556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.07556","snapshot_observed_at":"2026-08-06T21:23:53.666023Z","title":"SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis","venue":"eess.AS","work_id":"6e86b474-c712-4e8f-9d6c-3f2316f9b89d","year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.548122Z"},"links":{"cited_paper":"/paper/2409.07556","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:c38ea6175b9ccd97f87cdc808ce0dde2e2acea8aec03eeaccbb5f7c3cb7d9fa5","observation_id":"02eeabf4-9992-46e8-b95d-3e9fb890efc7","resolution":{"observed_at":"2026-08-06T21:23:53.712615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T21:23:51.703103Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.703103Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:f7c35c6f3777c0afc0116fab60aba9f66eb595ab819dac57eb4d665997a1098d","observation_id":"824d47ee-60fe-4859-b56e-c26291a5af5e","resolution":{"observed_at":"2026-08-06T21:23:51.703103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:51.927221Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:51.927221Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:5ee2629d0faa6d2518e39f2dd4977186f9ea920dbf59560241e005ce4067f14c","observation_id":"9ae2daa9-6aba-4670-8a54-0512751c1724","resolution":{"observed_at":"2026-08-06T21:23:51.927221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T21:23:52.244690Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.244690Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:58af93319aee80e22b77cfdaedb3ef2b7bb0216eec3dcfb0a0eef52d07d6f488","observation_id":"a0716cfd-1be5-4404-b1eb-a91a8fb0ecfa","resolution":{"observed_at":"2026-08-06T21:23:52.244690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-17T12:01:30.659594Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-06T21:23:52.397089Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.397089Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:b269efb4d95c86fca5b2f1c0474364c831745b3b650c824d2128c22170cb4058","observation_id":"09561bf6-690f-4de4-9bec-0780c6c14941","resolution":{"observed_at":"2026-08-06T21:23:52.397089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:54.417793Z","title":"Glow-tts: A genera- tive flow for text-to-speech via monotonic alignment search,","venue":null,"work_id":"989fdbb3-0932-43ea-a236-04ae8e4d206f","year":2020},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.542844Z"},"links":{"citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:aed51dbca2bddd8b1216e9cc8a7e43d8be788e40a6437c124f61af10c7d801f6","observation_id":"089e98bd-4114-4964-bf2b-ecf40630e816","resolution":{"observed_at":"2026-08-06T21:23:54.495771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-16T15:35:40.710158Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-06T21:23:52.752336Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.752336Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:8be179c7309396494c24fe81bc29062f3d0ae009b851fb29c6cbda59d58e0bdf","observation_id":"416732da-24e4-4e09-9e70-d2114e6776df","resolution":{"observed_at":"2026-08-06T21:23:52.752336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07889","last_updated":"2021-06-15T05:35:34Z","snapshot_observed_at":"2026-08-17T20:24:31.954061Z","submitted_at":"2021-06-15T05:35:34Z","title":"UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07889","snapshot_observed_at":"2026-08-06T21:23:52.972604Z","title":"Univnet: A neural vocoder with multi-resolution spectrogram discrimi- nators for high-fidelity waveform generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.972604Z"},"links":{"cited_paper":"/paper/2106.07889","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:4a1ef10860cb504b4e5ebe5d884c229ab206342103d784703eab4653269b7e43","observation_id":"c8af0324-78ea-4ecb-b44b-104148aad9b4","resolution":{"observed_at":"2026-08-06T21:23:52.972604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11673","last_updated":"2021-04-23T16:05:20Z","snapshot_observed_at":"2026-08-16T18:29:29.033632Z","submitted_at":"2021-04-23T16:05:20Z","title":"Deep Learning Based Assessment of Synthetic Speech Naturalness","version":1},"cited_work":{"arxiv_id":"2104.11673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.11673","snapshot_observed_at":"2026-08-06T21:23:53.400590Z","title":"Deep Learning Based Assessment of Synthetic Speech Naturalness","venue":"cs.SD","work_id":"7223da28-149e-4705-a8f2-b28ceccded27","year":2021},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:53.153699Z"},"links":{"cited_paper":"/paper/2104.11673","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:44fe6aa7b416c18ef55f45cbf6f57f9f5d8af551e82081b0143e67d1a84291bd","observation_id":"1dd4bc21-92bd-4520-bd50-7f7ad9e468a6","resolution":{"observed_at":"2026-08-06T21:23:53.453912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T21:23:52.083979Z","title":"Available: https://arxiv.org/abs/2412.10117","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:52.083979Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.00324"},"observation_digest":"sha256:859b720d22662e0ee294d8f6d51d59ae61d1dca8ea681ea073cf5d75ab694a52","observation_id":"94fc393c-e3fe-4e56-996a-d6340c2ed578","resolution":{"observed_at":"2026-08-06T21:23:52.083979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00324","last_updated":"2025-06-30T23:41:04Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T10:11:53.765749Z","submitted_at":"2025-06-30T23:41:04Z","title":"Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":4,"verified_fuzzy":24},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2507.00324."}