{"as_of":"2026-08-20T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5472d82feda535dbdde0be6c3843523d838c2a87bd02e9ddac7b48d09013394","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:24:22.463020Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09032/citation-record","integrity":"/paper/2412.09032/integrity","json":"/paper/2412.09032/citation-record.json","paper":"/paper/2412.09032"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:23.030039Z","title":"Spoofing countermeasures for the protection of automatic speaker recognition systems against attacks with artificial signals","venue":null,"work_id":"9715b77b-6add-4a9c-96c1-f5e4f76a8f6e","year":2012},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.318395Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:f01218cd9c0e52254ad41f04bd482d072d00d360f71048247b02aef5db3521ee","observation_id":"a6d995bb-b1f7-427a-9a27-5f807032cc6c","resolution":{"observed_at":"2026-08-11T17:24:23.033528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00501","last_updated":"2019-06-30T23:58:28Z","snapshot_observed_at":"2026-07-06T08:03:56.215960Z","submitted_at":"2019-06-30T23:58:28Z","title":"Deep Residual Neural Networks for Audio Spoofing Detection","version":1},"cited_work":{"arxiv_id":"1907.00501","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00501","snapshot_observed_at":"2026-08-11T17:24:22.748115Z","title":"Deep Residual Neural Networks for Audio Spoofing Detection","venue":"cs.LG","work_id":"5d212263-75eb-4291-abeb-5529aef1c53f","year":2019},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.322620Z"},"links":{"cited_paper":"/paper/1907.00501","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:954badc4757234ebfd4c9869e8e8ec3196becdfb63f88dc2be4085d222c93783","observation_id":"92220004-9ea6-48da-83b1-897812b038be","resolution":{"observed_at":"2026-08-11T17:24:22.752022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:23.020572Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"fffabf76-d2a2-4d39-986c-0dd752393838","year":2020},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.326606Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:81a2b19c2b03150a717f4f76ee110abefbbb12fd1d6380d9a1bdca07c1a53cec","observation_id":"7a288da7-442b-4e0b-9d43-f38b0707a1c7","resolution":{"observed_at":"2026-08-11T17:24:23.024042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:23.010437Z","title":"Waveform boundary detection for partially spoofed audio","venue":null,"work_id":"76bdc5da-3bde-42a0-a679-69431732a200","year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.331982Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:f231125e78c876f73f7ecac50d76fe24b3f45b4d863af25dd33007881ac83f14","observation_id":"08bb22c2-d929-4f43-85da-2a8cb6e023b4","resolution":{"observed_at":"2026-08-11T17:24:23.014011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10281","last_updated":"2023-08-20T14:29:04Z","snapshot_observed_at":"2026-08-18T21:50:16.222049Z","submitted_at":"2023-08-20T14:29:04Z","title":"The DKU-DUKEECE System for the Manipulation Region Location Task of ADD 2023","version":1},"cited_work":{"arxiv_id":"2308.10281","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10281","snapshot_observed_at":"2026-08-11T17:24:22.732646Z","title":"The DKU-DUKEECE System for the Manipulation Region Location Task of ADD 2023","venue":"eess.AS","work_id":"c498d916-11d9-4a05-bd02-8f46c7a4e171","year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.335949Z"},"links":{"cited_paper":"/paper/2308.10281","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:2858ef759812ee33832e0c6f7fd20573e76dcb724e37a08f8e880daf5c7bc48c","observation_id":"31ad5b6f-cd86-46a4-9bd3-685ed3011d42","resolution":{"observed_at":"2026-08-11T17:24:22.737955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:23.000689Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"3a1bc290-d54e-496f-966a-f6ab9c8155a3","year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.339515Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:17f56cc4f6437d2749cbcc334be2c6e11b1de51f38872639fdc836ee70b92907","observation_id":"e83486a8-5db2-4d13-94de-cc3036e57305","resolution":{"observed_at":"2026-08-11T17:24:23.004306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-08-18T06:21:12.766256Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-08-11T17:24:22.342603Z","title":"Wavefake: A data set to facilitate audio deepfake detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.342603Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:caaff3072c7875cc4f5d121888eecae413743ddae3e33171321f314946e34705","observation_id":"dce39ae0-8621-465d-a8b5-71cad0019bd0","resolution":{"observed_at":"2026-08-11T17:24:22.342603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.990443Z","title":"Aasist: Audio anti-spoofing using integrated spectro-temporal graph attention networks","venue":null,"work_id":"abc7efb9-fe32-4491-bb99-ca8fd1cbe2e6","year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.345768Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:a4b7d011fd62794c6342e8d873ed1af249d8a2c0fc919916da45afcfd88ca933","observation_id":"0f949aa9-723a-46e2-b233-7c94fbf6cddc","resolution":{"observed_at":"2026-08-11T17:24:22.994462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14732","last_updated":"2022-03-28T13:19:14Z","snapshot_observed_at":"2026-08-19T16:02:43.332568Z","submitted_at":"2022-03-28T13:19:14Z","title":"SASV 2022: The First Spoofing-Aware Speaker Verification Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14732","snapshot_observed_at":"2026-08-11T17:24:22.348820Z","title":"Sasv 2022: The first spoofing-aware speaker verification challenge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.348820Z"},"links":{"cited_paper":"/paper/2203.14732","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:738e3702163d0351e7534e8df1fe094bff97fc586f93a9ce52f01b972f7cc97e","observation_id":"677ef5ad-e3f5-4987-88df-068476287c2d","resolution":{"observed_at":"2026-08-11T17:24:22.348820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.980299Z","title":"Application of the electrical network frequency (enf) criterion: A case of a digital recording","venue":null,"work_id":"6588efb4-a95c-49a9-9695-3a34cf7e9f95","year":2005},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.352425Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:d128cc5946fe6d35aa13a2639c2fbd6ec9646547a933e3ec33b064d5d81001d6","observation_id":"4d921a96-c5b4-44d5-a66f-04cc061a0835","resolution":{"observed_at":"2026-08-11T17:24:22.984089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.969304Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"aee7245a-8a0b-4b70-bb01-9db3e08eb7e9","year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.355852Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:d5fba442c43ac2a1dfc9e8f3127a77c72fa7e235891b18b45a373854b59fd804","observation_id":"2bc74128-ca60-4c2a-a669-98d15a4dae93","resolution":{"observed_at":"2026-08-11T17:24:22.973032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05576","last_updated":"2019-04-11T08:37:43Z","snapshot_observed_at":"2026-08-14T17:36:55.699850Z","submitted_at":"2019-04-11T08:37:43Z","title":"STC Antispoofing Systems for the ASVspoof2019 Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05576","snapshot_observed_at":"2026-08-11T17:24:22.359356Z","title":"Stc antispoofing systems for the asvspoof2019 challenge","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.359356Z"},"links":{"cited_paper":"/paper/1904.05576","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:95a281a244d9e97f7e1e37cba150f49c3d173f05de3813dc4303ef6ac7793001","observation_id":"856bb995-a342-4b06-b09d-253d83f6e8f3","resolution":{"observed_at":"2026-08-11T17:24:22.359356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.958780Z","title":"Multi-grained backend fusion for manipulation region location of partially fake audio","venue":null,"work_id":"cde50665-c929-413a-b46e-a901829ec25e","year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.363171Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:bd5761b3b9ed37fa7101af0f58f881d96adfc29d089750441edd006a3d2a822d","observation_id":"4501229f-e201-4ef7-a9ce-834c6dceb045","resolution":{"observed_at":"2026-08-11T17:24:22.962699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.948623Z","title":"Convolutional recurrent neural network and multitask learning for manipulation region location","venue":null,"work_id":"fcb98b7c-3507-44de-8ddd-118c7366c137","year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.366490Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:fcd61bb3b9f51d91cf2299db2b23f8d13a19f9b38a9f7d82e53616495a03afc7","observation_id":"267c147b-945d-44a8-a90b-86b30e79abda","resolution":{"observed_at":"2026-08-11T17:24:22.952333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.938121Z","title":"Single shot temporal action detection","venue":null,"work_id":"7a490bae-30af-4e94-a2ee-e8fa551d27f8","year":2017},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.369678Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:188f07daad82874cce594a4a620ee6538b9cff4c10274e3e72a4cb12ae5fc438","observation_id":"c09540c1-c756-42f6-b11b-ba6f089954f1","resolution":{"observed_at":"2026-08-11T17:24:22.942184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.927574Z","title":"Gaussian temporal awareness networks for action localization","venue":null,"work_id":"af7615bd-555f-46e9-8ebc-1a27a43fb29e","year":2019},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.372760Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:222101bc6c23cad7f12fce81f214e1052058b269f514183fa5178dd5b1fca3a1","observation_id":"7247ca58-a1c8-44e2-be46-9b9501f0b73a","resolution":{"observed_at":"2026-08-11T17:24:22.931342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T17:24:22.375953Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.375953Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:00a1767d9ce1690f027173dd18d229775d97eac0c888ef7d85e9e6ad9f6d7d28","observation_id":"d24612d3-acd4-4bd7-83f7-68b620742567","resolution":{"observed_at":"2026-08-11T17:24:22.375953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.917559Z","title":"Detecting unknown speech spoofing algorithms with nearest neighbors","venue":null,"work_id":"edc3def6-589d-47fa-b342-de7b15c3a7e0","year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.379583Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:ca6a5aeeea7a1cb9aedefea8bb883944b7db0820a63b552dcfffb89c1f41d356","observation_id":"d1cbe032-a287-4ec8-a2b6-a2d1015016d0","resolution":{"observed_at":"2026-08-11T17:24:22.921089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.906946Z","title":"Audio forensics from acoustic reverberation","venue":null,"work_id":"da3bab5f-5ae4-4e2c-855d-fb74d98e5483","year":2010},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.382735Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:aa9948d05c220de6d0067e388e6c42d648779016009a6802c1e4fc82671fbc1d","observation_id":"e20c3cdc-5e1b-4ae5-9e0b-456deb337285","resolution":{"observed_at":"2026-08-11T17:24:22.910773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.386003Z","title":"u ller, Pavel Czempin, Franziska Dieckmann, Adam Froghyar, and Konstantin B \\","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.386003Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:05105dfb558474e08ab9d8324ea5476ea17e024c0b279932ca1589b1da56ef81","observation_id":"13f0be65-d638-4c33-94d0-8f0810e463d0","resolution":{"observed_at":"2026-08-11T17:24:22.386003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T17:24:22.390076Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.390076Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:c225cebe8b6657aa381be5d3fed90813a9c8e7a7589a8765a0eeaae80891f471","observation_id":"5aa73031-419c-4f51-a949-4ed69ad28f61","resolution":{"observed_at":"2026-08-11T17:24:22.390076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.896995Z","title":"From speaker verification to deepfake algorithm recognition: Our learned lessons from add2023 track3","venue":null,"work_id":"ce6b1ba1-e419-4323-9f31-7d74dbff2fa1","year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.393524Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:90fb8cdbf9f5e940742be4bb0833567b897d7ac9ba626b496606fba1b5d87b0a","observation_id":"41c68639-8e85-4c88-bc94-6f09ffb21ac3","resolution":{"observed_at":"2026-08-11T17:24:22.900673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.886946Z","title":"For: A dataset for synthetic speech detection","venue":null,"work_id":"d7a2536e-5958-41a8-a039-c1e43de0d592","year":2019},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.396645Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:bf0ab66ad9ca355491093e0b85d4438b77f083b947226cf90588b57b084a3ddf","observation_id":"740178de-963f-4ca1-98ba-c95160220cfb","resolution":{"observed_at":"2026-08-11T17:24:22.890518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.877913Z","title":"Transformer language models with lstm-based cross-utterance information representation","venue":null,"work_id":"5d930c2f-d1c9-44e0-a881-82cbae6f29db","year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.399903Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:cbdf6eccc4d9bb6cd1307880f4ba0cafbb5f8180b691478377116f33cf174626","observation_id":"f75e8faa-f601-473f-8026-326773a02e24","resolution":{"observed_at":"2026-08-11T17:24:22.880964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.869335Z","title":"End-to-end anti-spoofing with rawnet2","venue":null,"work_id":"2a6c1f92-ac92-43b1-8529-bc86b41f709a","year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.403243Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:a627ccc08a98e5189d76cb48cfde28c37921a38c99bcc87f5b7a50aa157e8971","observation_id":"27138424-c667-4405-9640-5dbb183d9485","resolution":{"observed_at":"2026-08-11T17:24:22.872344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05441","last_updated":"2019-04-14T11:38:32Z","snapshot_observed_at":"2026-08-15T22:10:10.299222Z","submitted_at":"2019-04-09T15:12:52Z","title":"ASVspoof 2019: Future Horizons in Spoofed and Fake Audio Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05441","snapshot_observed_at":"2026-08-11T17:24:22.406661Z","title":"Asvspoof 2019: Future horizons in spoofed and fake audio detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.406661Z"},"links":{"cited_paper":"/paper/1904.05441","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:6e947958388bfa44fec5575d292197b3fc0ccfa48ee869611fedddcbba8f53d8","observation_id":"9d878dfa-ad6f-43da-80d1-fc138e4b9fa6","resolution":{"observed_at":"2026-08-11T17:24:22.406661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.860141Z","title":"Spoofing detection with dnn and one-class svm for the asvspoof 2015 challenge","venue":null,"work_id":"d921af83-42aa-4649-8183-be95f815fa2f","year":2015},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.410276Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:1b31e0ed3969ede3164d8c1df19db0a685da88398421ada67d6c2c50c5b80add","observation_id":"daccce08-0b4f-4ed6-a69e-e5415a030458","resolution":{"observed_at":"2026-08-11T17:24:22.863626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-17T12:01:30.659594Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-11T17:24:22.413789Z","title":"Tacotron: A fully end-to-end text-to-speech synthesis model","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.413789Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:279b271338a1cd204856d79dea2d342d320e7af73fb3365b100d0cd918709128","observation_id":"331c1ca5-b8d4-42fb-ad89-26a8d430e5ce","resolution":{"observed_at":"2026-08-11T17:24:22.413789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.850407Z","title":"Asvspoof 2019: A large-scale public database of synthesized, converted and replayed speech","venue":null,"work_id":"4fd6925b-11f3-4e32-890b-69539218d484","year":2019},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.416798Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:086c877387af4217b27c82ff706dd3a0c34c2fb428545ea468181da12f1a4b02","observation_id":"212d1436-3813-46ea-a630-f0df7501a24a","resolution":{"observed_at":"2026-08-11T17:24:22.853933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.840817Z","title":"Sas: A speaker verification spoofing database containing diverse attacks","venue":null,"work_id":"99d78d74-b933-4619-909d-4cf13a8accf1","year":2015},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.419534Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:0f691961832cc0c75d6639c6aed25d207b14f117cb9b450523abb008171942f9","observation_id":"5737d445-a07f-4063-aad8-0685b67b7d25","resolution":{"observed_at":"2026-08-11T17:24:22.844231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00537","last_updated":"2021-09-01T16:17:31Z","snapshot_observed_at":"2026-08-19T16:02:42.770315Z","submitted_at":"2021-09-01T16:17:31Z","title":"ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00537","snapshot_observed_at":"2026-08-11T17:24:22.422384Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.422384Z"},"links":{"cited_paper":"/paper/2109.00537","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:7affe76b6396ce0d5114afb45e986cf0ff4479a31177a9c2f01baf76d8858339","observation_id":"9b7f3e3f-949f-460d-ad38-484526177200","resolution":{"observed_at":"2026-08-11T17:24:22.422384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.830727Z","title":"Detecting digital audio forgeries by checking frame offsets","venue":null,"work_id":"7e0f2509-615b-48db-8914-72d06ba3bcb3","year":2008},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.425536Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:4078fd33dc7ef1c3cc7082cf75fa2e46823f62bb09a6c74b075295599ed83fe0","observation_id":"17e9d558-3eaf-4e88-aa08-268e5bab0937","resolution":{"observed_at":"2026-08-11T17:24:22.834575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.820372Z","title":"Revisiting anchor mechanisms for temporal action localization","venue":null,"work_id":"5f449798-f19c-418d-84ed-f8e34b076067","year":2020},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.429716Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:971177983fb9cb4631c406e7654eea9a2ea6021d77705b21c496fae90c1befcb","observation_id":"37b3cb0b-11fb-4a5b-84d9-0cfa8241ef42","resolution":{"observed_at":"2026-08-11T17:24:22.824048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T17:24:22.432903Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.432903Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:a5e9d5f9a21e2b936c8e15c139ae0421554b0f9aa5955a62d0ad62ec4ae519c0","observation_id":"aa365929-7583-4da4-924a-e36fdb2f6d70","resolution":{"observed_at":"2026-08-11T17:24:22.432903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03617","last_updated":"2023-12-16T02:17:19Z","snapshot_observed_at":"2026-08-19T13:15:12.987667Z","submitted_at":"2021-04-08T08:57:13Z","title":"Half-Truth: A Partially Fake Audio Detection Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03617","snapshot_observed_at":"2026-08-11T17:24:22.436246Z","title":"Half-truth: A partially fake audio detection dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.436246Z"},"links":{"cited_paper":"/paper/2104.03617","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:60b0724909c6983d048164b807f60e537280ee6c35d9f547665725281cfaab7d","observation_id":"50f5ed7f-5e8a-4f4c-97f9-3ca5a97327a4","resolution":{"observed_at":"2026-08-11T17:24:22.436246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.809598Z","title":"Add 2022: the first audio deep synthesis detection challenge","venue":null,"work_id":"3b08d8d0-e82a-49cf-bf2d-4558182d41f6","year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.440011Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:b636c59b38180b254b7c9951e11426dc3cd4a6e47e0769fa173b1d6b1cd6acee","observation_id":"88ff7d46-976a-4e83-a7f5-e85b33a16063","resolution":{"observed_at":"2026-08-11T17:24:22.813565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-08-20T03:00:07.655339Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-08-11T17:24:22.443432Z","title":"Add 2023: the second audio deepfake detection challenge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.443432Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:63963964c6a289904d97a22df23eed298d95bd6af29bafa8dd540845a0eec833","observation_id":"3447e132-51ed-41fe-b91f-ecad92a411c6","resolution":{"observed_at":"2026-08-11T17:24:22.443432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.798420Z","title":"Searching multi-rate and multi-modal temporal enhanced networks for gesture recognition","venue":null,"work_id":"cd3b12cb-9a4a-4503-b7d8-dd27cd57ef02","year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.446815Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:22d49d70db1ec0b28fda4e6c3b3a91c4b34350775375506bb987a67241744727","observation_id":"e8c50d3d-fff2-422c-8966-831579f935fe","resolution":{"observed_at":"2026-08-11T17:24:22.802122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.787772Z","title":"Deepfake algorithm recognition system with augmented data for add 2023 challenge","venue":null,"work_id":"07678336-0353-45cd-b347-2626ba71bf89","year":2023},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.449823Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:20b98825725c64887509443b30f9d3645adc6dcc49d6e95b206563dbe29622ca","observation_id":"10cbb280-92ae-4260-bb76-48d67327323f","resolution":{"observed_at":"2026-08-11T17:24:22.791485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02518","last_updated":"2021-06-15T15:41:34Z","snapshot_observed_at":"2026-08-19T16:02:41.796780Z","submitted_at":"2021-04-06T13:52:31Z","title":"An Initial Investigation for Detecting Partially Spoofed Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02518","snapshot_observed_at":"2026-08-11T17:24:22.453002Z","title":"An initial investigation for detecting partially spoofed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.453002Z"},"links":{"cited_paper":"/paper/2104.02518","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:4c9e625ba97b36eb8d7bb5f0f5a17e5081b420b6869851513463bd0c2ab1a43c","observation_id":"e5990417-5834-4d9e-b2d3-208104f4caa0","resolution":{"observed_at":"2026-08-11T17:24:22.453002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.776615Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"36776816-6e2b-44ea-89c6-9e5c3d4c2802","year":2022},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.456448Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:34ddf383425252e827552b6fe543f6769c7f416a53633bf0107318f4da1a7728","observation_id":"0925d8e0-471d-4749-adcc-24a698e22423","resolution":{"observed_at":"2026-08-11T17:24:22.780612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.766049Z","title":"Audio recording location identification using acoustic environment signature","venue":null,"work_id":"b88f8de8-a390-46ed-a86b-34f2223c4fd5","year":2013},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.460003Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:1ad0a8a5546916618116fcbb45e70e96d0798014df9a35603b555a4f5498f8b3","observation_id":"395b5225-5a54-4eeb-a774-e2630a09bd58","resolution":{"observed_at":"2026-08-11T17:24:22.769870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:24:22.463020Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.463020Z"},"links":{"citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:371c09963b3fea35441bfacdeea41c5003e01b7b808770ee26eb0ea48a303772","observation_id":"87e07a23-9dc4-44ff-83e3-10c1c2de7943","resolution":{"observed_at":"2026-08-11T17:24:22.463020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2412.09032."}