{"as_of":"2026-08-14T13:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f77492abb89600d46cbb748b39ca6ba66cffdc8d2a48f4679f998fc1af0bfa4","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:27:59.124425Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:12:30.668116Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00251","snapshot_observed_at":"2026-08-02T01:12:30.668116Z","title":"Alethia: A foun- dational encoder for voice deepfakes,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14753","last_updated":"2026-07-16T09:38:45Z","snapshot_observed_at":"2026-08-14T02:41:14.466076Z","submitted_at":"2026-07-16T09:38:45Z","title":"Large Audio Language Models for Spoofing-Aware Speaker Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:12:30.668116Z"},"links":{"cited_paper":"/paper/2605.00251","citing_paper":"/paper/2607.14753"},"observation_digest":"sha256:1859d7497fd52f6f9463868eb643831ea0c8ccf5a6938ebf7b90ee24d186a7e2","observation_id":"31613142-6035-4ac0-af9c-3f340d2897df","resolution":{"observed_at":"2026-08-02T01:12:30.668116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.00251/citation-record","integrity":"/paper/2605.00251/integrity","json":"/paper/2605.00251/citation-record.json","paper":"/paper/2605.00251"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:7ae145b9bd19a2881fecb22b9b4aa128db633ff7ec0a65b7960c9d39532ce72f","observation_id":"641850ff-482e-422d-952e-a48fbe8847fa","resolution":{"observed_at":"2026-05-11T15:41:33.204364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring audio deepfake detection capabil- ity across languages","venue":null,"work_id":"336ca3c7-2fd0-48c3-b188-2d806443e183","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:28094e830c5bdfcac8256435f4d0626d2b09544d91e958db802711c45ff61a1d","observation_id":"9d1c0c32-53fb-4c50-9523-59b0afd95d6c","resolution":{"observed_at":"2026-05-25T21:26:15.440406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11337","last_updated":"2024-02-17T17:08:16Z","snapshot_observed_at":"2026-08-13T04:16:59.509173Z","submitted_at":"2024-02-17T17:08:16Z","title":"Learning by Reconstruction Produces Uninformative Features For Perception","version":1},"cited_work":{"arxiv_id":"2402.11337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11337","snapshot_observed_at":"2026-06-28T19:12:34.907582Z","title":"Learning by reconstruction produces uninformative features for perception","venue":null,"work_id":"d4867e4d-548c-404c-8a82-645e2813010f","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2402.11337","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:2828506fe6c4b7c439a4b0bf41750ff0e2dc0d6c33e2d35627bfdf0fa86a925d","observation_id":"7bbd27c9-76fe-4fe9-b43c-b64d3365c9ba","resolution":{"observed_at":"2026-05-11T15:41:33.295146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f0fd219-dec6-4f5a-af8e-b99c6efe3a3b","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:9043391471c4c5b666245749a4ed4cabf06a40897a166e84040411228e4c867e","observation_id":"48e383b4-6414-4ccd-9d0e-b2937a6c30c6","resolution":{"observed_at":"2026-05-25T21:26:15.437118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-08-07T17:29:40.662418Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":"2503.02857","doi":"10.1007/s44267-025-00100-2","metadata_source":"pith","pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","venue":"cs.CV","work_id":"d1bf3332-d565-448c-8175-e624da877d13","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:5950a18c96be1697eee3d56b7e39eddaf20f7067a33fd150f7d45dadf0c13e6f","observation_id":"620aedc2-c342-4ea4-9c12-2a2fd41977c0","resolution":{"observed_at":"2026-05-28T02:04:08.212974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoLLD: Contrastive layer-to-layer distil- lation for compressing multilingual pre-trained speech encoders","venue":null,"work_id":"e40d81c3-2faa-4feb-981d-56d4f7e4f676","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:3147b800f605fb746f31d87eed876d33ff5d32a03c6e2c2338dc9263c6820828","observation_id":"a0a9749f-0886-48cb-9feb-c36f9e79e3d5","resolution":{"observed_at":"2026-05-25T21:26:15.443193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":"2506.18843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usad: Universal speech and audio representation via distillation.arXiv preprint arXiv:2506.18843","venue":null,"work_id":"7b36bf96-cc69-440d-93c0-c978e50e271f","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:877f1d06c0009de79db0e26f82b16c046a728a77833c32dc950cf7ef853d71e1","observation_id":"b3c39e7d-ebbd-417a-bfa5-7ab57dcca0a4","resolution":{"observed_at":"2026-05-11T15:41:33.721376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Demir¨ors, M., Ozbayoglu, A","venue":null,"work_id":"03b8c757-cb32-4f47-9354-07acca324267","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:ebd3edd2ee9c6ab98184071a3f5a704e6838768d6aca77adebbeea56e455b520","observation_id":"959fdc7d-61b5-4113-81c0-59a1e5dfdb88","resolution":{"observed_at":"2026-05-25T21:26:15.427302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trident of poseidon: A generalized approach for detecting deepfake voices","venue":null,"work_id":"9b65de53-4fb3-435f-ae9c-7e06e2d2fe03","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:5b69e16d56a390b61b3349cca7602d4fc549058a4fde345e61c64caa9fb63fdc","observation_id":"ec839b8c-84cd-4a80-8dd8-28bb7f05535e","resolution":{"observed_at":"2026-05-25T21:26:15.422498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T., Manrique, R., and Nunes, B","venue":null,"work_id":"cca3d4b3-ca2e-4f80-8106-71be63e115dc","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:310cdd95d00f10e3f4b2db2ffb93aad0726f0d423fb15f2e717643893ac51110","observation_id":"cd5b9cba-767b-4ba0-b146-8cd0edf47473","resolution":{"observed_at":"2026-05-25T21:26:15.424855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05674","last_updated":"2025-05-22T06:13:29Z","snapshot_observed_at":"2026-08-09T08:35:41.757812Z","submitted_at":"2025-02-08T19:49:09Z","title":"ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts","version":4},"cited_work":{"arxiv_id":"2502.05674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05674","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L., Garc´ıa-Perera, L","venue":null,"work_id":"2ff9b0ca-10b4-4564-a421-a9026d28996a","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2502.05674","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:bbb62e6d303483b2b11e6ff83c826e6a12f11d50a62a85d70b81d7a3a8d4b7cf","observation_id":"265e0227-7795-4c2a-a43c-233ec782d76d","resolution":{"observed_at":"2026-05-11T15:41:31.105348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:37:25.495539Z","title":"Post-training for deepfake speech de- tection.arXiv preprint arXiv:2506.21090","venue":null,"work_id":"f6d62c6a-5d65-47ef-8b15-44fa1a619d08","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:007e9386fda2bd773f8bd0b416b3492470c51671ce6d5d5a26ffe6878f34fe17","observation_id":"7640aea8-f2a2-4703-9bdc-21922a0b421c","resolution":{"observed_at":"2026-05-11T15:41:35.515762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03365","last_updated":"2019-07-02T04:42:17Z","snapshot_observed_at":"2026-07-06T07:44:19.552249Z","submitted_at":"2019-04-06T05:42:18Z","title":"ReMASC: Realistic Replay Attack Corpus for Voice Controlled Systems","version":2},"cited_work":{"arxiv_id":"1904.03365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.03365","snapshot_observed_at":"2026-07-04T23:45:46.948480Z","title":"ReMASC: Realistic replay attack corpus for voice controlled systems.arXiv preprint arXiv:1904.03365","venue":null,"work_id":"60b48f9d-652e-412f-aa31-4ae94021b601","year":1904},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/1904.03365","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:16697e7a8631b8943ce21290cd6090bece7eb1d8cc68785b01c166219e96ec80","observation_id":"7933d3d9-79f2-4a52-ab0a-670c1d26897c","resolution":{"observed_at":"2026-07-04T23:45:46.948480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., Avila, A","venue":null,"work_id":"88151186-bcd7-4e06-b911-bc7e5179ae3c","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:245d03ff6f87925cd93b5d1f2258fc85f95b7a51fdc106e3b29bca4df3b63ddf","observation_id":"bfa253f2-f954-4410-b27e-8284d9e9d1f1","resolution":{"observed_at":"2026-05-25T21:26:15.434718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08654","last_updated":"2024-03-13T16:08:59Z","snapshot_observed_at":"2026-08-13T00:55:02.442125Z","submitted_at":"2024-03-13T16:08:59Z","title":"An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":"2403.08654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08654","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., Avila, A","venue":null,"work_id":"194d8ed5-30ad-444d-abb3-534df7e77114","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2403.08654","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:12f2ea350b73db05a7fd5cc1084a5906163fd19f587fb75fb96a8edc80ef6252","observation_id":"ffd426c4-a3c5-4a1e-b09c-22283fe12c2b","resolution":{"observed_at":"2026-05-11T15:41:30.569243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04161","last_updated":"2025-09-04T12:35:10Z","snapshot_observed_at":"2026-08-05T10:24:20.745277Z","submitted_at":"2025-09-04T12:35:10Z","title":"Wav2DF-TSL: Two-stage Learning with Efficient Pre-training and Hierarchical Experts Fusion for Robust Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":"2509.04161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04161","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wav2df-tsl: Two-stage learning with efficient pre-training and hierarchical experts fu- sion for robust audio deepfake detection.arXiv preprint arXiv:2509.04161","venue":null,"work_id":"04b6ab03-a7bc-4da9-aca3-a64f27de4cfc","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2509.04161","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:65e154730ea276c9f7955fb806342e926adf90a251f7e62bb34c1be7549e3dab","observation_id":"e60da123-abcf-460e-a92e-e8dbb05497e8","resolution":{"observed_at":"2026-05-11T15:41:32.948686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14396","last_updated":"2025-07-07T03:39:01Z","snapshot_observed_at":"2026-08-10T21:31:33.087326Z","submitted_at":"2025-06-17T10:51:34Z","title":"Manipulated Regions Localization For Partially Deepfake Audio: A Survey","version":2},"cited_work":{"arxiv_id":"2506.14396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14396","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manipulated re- gions localization for partially deepfake audio: A survey","venue":null,"work_id":"2ab79b19-ec58-462d-84c4-ce48ff23715e","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.14396","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:cd609c1571873e112d01e10cc16bbe7ec8e83cc43a66363f315d4d39d36e66ac","observation_id":"22f2ad38-e67a-41a7-a0b6-3621a7587aca","resolution":{"observed_at":"2026-05-11T15:41:34.085537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-10T15:09:41.229385Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"cited_work":{"arxiv_id":"2507.21463","doi":"10.48550/arxiv.2507.21463","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21463","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huzaifah, M., Lin, G., Liu, T., Sailor, H","venue":"arXiv (Cornell University)","work_id":"e10143f5-361c-43b2-85da-e76ca786ecd0","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2507.21463","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:838ed4951ca80b3eb79214120378150642c8f6b15f29bc8419e5462d629032b6","observation_id":"bf7a20ec-4abf-4975-8772-f9a17653c7c5","resolution":{"observed_at":"2026-05-11T15:41:35.077427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20067","last_updated":"2025-02-27T13:16:41Z","snapshot_observed_at":"2026-08-07T17:42:59.278834Z","submitted_at":"2025-02-27T13:16:41Z","title":"UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook","version":1},"cited_work":{"arxiv_id":"2502.20067","doi":"10.48550/arxiv.2502.20067","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20067","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UniCodec: Unified audio codec with single domain-adaptive codebook.arXiv preprint arXiv:2502.20067","venue":"ArXiv.org","work_id":"41222bdc-a942-4ca8-9628-d042985b8e0d","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2502.20067","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:81e992f99064323466f33aa95fd5ce4ba55b01d6fb4d6e75b7376026a101fda6","observation_id":"7aec9a64-e12e-4b43-b87a-772f5749caa8","resolution":{"observed_at":"2026-05-11T15:41:32.535227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., et al","venue":null,"work_id":"6678012c-682c-4635-a557-d372517bb17d","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:b2c96a3cb4b3444ace1abc41bbc4e04613bdab56f2b9934c8dd9aef117071e97","observation_id":"004b232c-6971-43c3-8c4b-3c74bd0f50e9","resolution":{"observed_at":"2026-05-25T21:26:15.414891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08016","last_updated":"2024-07-10T19:49:10Z","snapshot_observed_at":"2026-08-12T23:24:42.045149Z","submitted_at":"2024-07-10T19:49:10Z","title":"Source Tracing of Audio Deepfake Systems","version":1},"cited_work":{"arxiv_id":"2407.08016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08016","snapshot_observed_at":"2026-07-03T07:47:44.708019Z","title":"Source tracing of audio deepfake systems","venue":null,"work_id":"ab9795f8-fca2-420e-9096-d96bec567ca0","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2407.08016","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:6a1f94d916730355b8c0bd6e632ce508d0172809a4ffa434342514f50e8149f0","observation_id":"95430da1-9ed2-4b28-8b7d-cc3f1eab6971","resolution":{"observed_at":"2026-05-11T15:41:33.959367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19014","last_updated":"2025-06-26T17:21:45Z","snapshot_observed_at":"2026-08-06T23:11:55.924092Z","submitted_at":"2025-06-23T18:10:06Z","title":"IndieFake Dataset: A Benchmark Dataset for Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":"2506.19014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19014","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IndieFake dataset: A benchmark dataset for audio deepfake detection.arXiv preprint arXiv:2506.19014","venue":null,"work_id":"afca12d7-47ba-4015-9df9-3c928ea57dfc","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.19014","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:18015ad77ec3b16298890b48fdb6f0c82215da9da4c27cf53c6dca754de2e2d3","observation_id":"db490d85-3db8-45f7-a3c5-e367e0dc8cf0","resolution":{"observed_at":"2026-05-11T15:41:32.825794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on speech deepfake detection.ACM Computing Surveys, 57 (7):1–38, 2025a","venue":null,"work_id":"20b49222-dbc7-41c4-8826-a3120b09143b","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:dec98c4bf86c57e0484d440ec585df3713af1c700a7092b37e57ca02cf22013a","observation_id":"c21f4f4c-7721-4560-a33d-f6a9edee7702","resolution":{"observed_at":"2026-05-25T21:26:15.420026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17577","last_updated":"2026-07-05T21:12:59Z","snapshot_observed_at":"2026-08-13T18:16:07.698533Z","submitted_at":"2025-03-21T23:21:17Z","title":"Measuring the Robustness of Audio Deepfake Detection under Real-World Corruption","version":2},"cited_work":{"arxiv_id":"2503.17577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17577","snapshot_observed_at":"2026-07-07T02:18:24.167264Z","title":"Measuring the ro- bustness of audio deepfake detectors","venue":null,"work_id":"759209bd-fd61-4e75-9eb1-4d1797354c04","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2503.17577","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e2c59e3bd36dee61b6ba7979d95dc39983d9a2d9071bd30c003ca29d84a0d7bc","observation_id":"45bb5d01-2935-453b-8288-39b70abcc2d3","resolution":{"observed_at":"2026-07-07T02:18:24.167264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:df973dacd75c9684cea4a3a781ec0b1dd50aaf3ac1c853ce42fb903e308eb889","observation_id":"303860d8-5039-4cbd-a4bf-4b284ebb126e","resolution":{"observed_at":"2026-05-11T15:41:34.564428Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-08-13T05:41:00.933463Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":"2310.16338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-07-08T00:04:22.558026Z","title":"H., Le, M., Vyas, A., Shi, B., Tjandra, A., and Hsu, W.-N","venue":"eess.AS","work_id":"5f38b5bc-2b5a-4b19-9cea-17751b76c46b","year":2023},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:106a6757caf3e658982b8ec012a772eb1b8be33c8f998f26316803ec2259138e","observation_id":"54d60b93-9d0e-4c9f-bbf3-47f739e9f73c","resolution":{"observed_at":"2026-05-11T15:41:33.447165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A., and Chng, E","venue":null,"work_id":"3eb13da9-8155-4508-a36f-df0dbfe7446f","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:adfb5315b749d95d3312f105a1c1941d0b2ac6d6f8b75c97ef6b2009fbffc80f","observation_id":"73407916-7033-4ba0-a8ac-9eefc9445da5","resolution":{"observed_at":"2026-05-25T21:26:15.412803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23962","last_updated":"2025-05-29T19:32:57Z","snapshot_observed_at":"2026-08-07T12:35:44.304334Z","submitted_at":"2025-05-29T19:32:57Z","title":"Can Emotion Fool Anti-spoofing?","version":1},"cited_work":{"arxiv_id":"2505.23962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23962","snapshot_observed_at":"2026-06-29T13:33:28.656699Z","title":"R., Naini, A","venue":null,"work_id":"09c82968-b442-4ea1-832e-62e8d16e25bc","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2505.23962","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:47a3c29400990fcc1e746f8c78d4c6bd8907ff3d8292c2af5d4e628735bf6da8","observation_id":"3ab933b8-abae-4b07-bd9f-47b793255611","resolution":{"observed_at":"2026-05-11T15:41:30.964905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10274","doi":"10.48550/arxiv.2506.10274","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Discrete audio tokens: More than a survey!","venue":"ArXiv.org","work_id":"c89ef171-a1ea-49a1-8800-b9d5ef2dc175","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:bf811edf2f3ab33dbc81e822f9ddc5b0fc95bd5d1478a108dabc0545b6b8d1e4","observation_id":"14e2efef-894b-4138-b102-c69a60f8db54","resolution":{"observed_at":"2026-05-11T15:41:31.016439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14862","last_updated":"2025-06-01T04:46:35Z","snapshot_observed_at":"2026-08-09T01:01:16.294049Z","submitted_at":"2025-05-20T19:46:36Z","title":"Replay Attacks Against Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":"2505.14862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14862","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T., Pizzi, K., Wagner, A., and Sperl, P","venue":null,"work_id":"4ba25e4a-3fa2-4c98-901e-aee8f05dac9a","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2505.14862","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:5890e0153d68a68cc6cdc52ff11f823e359c5df0981b368f297865dfeceee942","observation_id":"a032c811-d589-4306-a92b-c6326b7389ac","resolution":{"observed_at":"2026-05-11T15:41:34.689109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12914","last_updated":"2021-09-28T09:06:33Z","snapshot_observed_at":"2026-08-13T18:58:45.544887Z","submitted_at":"2021-06-23T08:28:59Z","title":"Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?","version":4},"cited_work":{"arxiv_id":"2106.12914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.12914","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech is silver, silence is golden: What do ASVspoof-trained models really learn?","venue":null,"work_id":"e113186f-49e4-4a5b-a25c-63c2cf1a386b","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2106.12914","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:01cb59b7263c2939d934c587178957cdfc59ea5816ad30271a0a9de3075925a9","observation_id":"d350a536-2e4e-4c06-976a-453ad440e1ac","resolution":{"observed_at":"2026-05-11T15:41:30.779331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H., Vest- man, V ., Todisco, M., Delgado, H., Sahidullah, M., Yam- agishi, J., and Lee, K","venue":null,"work_id":"e6609da1-38fb-45fc-97b9-5ba94282b54b","year":2019},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:b9f85f625346e85f48ef1c26b90d7836e4ff11bbbc1fa45bc55057c58c682f87","observation_id":"da469195-752a-499e-ae69-431c1a6f9e30","resolution":{"observed_at":"2026-05-25T21:26:15.417453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4863765e-f97a-4c23-8761-4c1dd9f2c1b6","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:2232ccc3290ace28bfe6e0e7f0b92830762787adebd894cc9a7e9b823411764f","observation_id":"e04cab96-3f1c-47ae-86d1-43213eebbbf4","resolution":{"observed_at":"2026-05-25T21:26:15.432278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:06:37.794172Z","title":"Singing voice graph modeling for singfake detection","venue":null,"work_id":"3c3dc12b-b160-46ce-956c-7d0499a00ba2","year":2019},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:205e2c5113139f246c6dd3eb976cadada998e885054bc585040fd65e952c9891","observation_id":"abfa597c-d941-4c84-855a-86aa33d20697","resolution":{"observed_at":"2026-05-09T19:30:37.083915Z","resolver_source":"doi","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07254","last_updated":"2024-06-11T13:34:40Z","snapshot_observed_at":"2026-08-12T23:45:33.929500Z","submitted_at":"2024-06-11T13:34:40Z","title":"SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark","version":1},"cited_work":{"arxiv_id":"2406.07254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SRC4VC: Smartphone-recorded corpus for voice conversion bench- mark.arXiv preprint arXiv:2406.07254","venue":null,"work_id":"56a50f24-311f-4b29-b7f6-185e12523175","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2406.07254","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:f652500c49a35b9bd0a9bd94189fd23f0062edc82fb77e5f1035f2e8f9780f06","observation_id":"73cbbff2-7736-4303-bc6e-4260e8bc823b","resolution":{"observed_at":"2026-05-11T15:41:31.478174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-10T14:44:27.962270Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":"1711.00354","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-07-04T20:30:08.172073Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","venue":"cs.CL","work_id":"84194a92-6891-4d35-85e6-56cbc1068f0d","year":2017},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:07fc7640e360fa651c0ae42276734a7c9628e0eb3687a914ddc0893861f93106","observation_id":"03a1d533-cd23-418f-bf37-2266a05e30a1","resolution":{"observed_at":"2026-05-11T15:41:34.878535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti-spoofing","venue":null,"work_id":"3d4568dc-4187-4ace-9f3d-7fb01979f28f","year":2022},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:08d18172062b2cd87a42e352dbcc537b7303652b2ee9b95c2f2a6f3ae278df35","observation_id":"30c8161e-e91a-4a12-a01a-09b12f8d5b39","resolution":{"observed_at":"2026-05-25T21:26:15.429930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JMD: Japanese multi-dialect corpus for speech synthesis","venue":null,"work_id":"06318c0a-8d49-4ca3-bd04-24c8ff48d9e5","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:3cd67b28d3a3fb1ec0183f0b007e8c7d050e8c3ec0b57dac8a78042d632d13ad","observation_id":"6e8d119b-6a94-4ae4-b973-2d391c135383","resolution":{"observed_at":"2026-05-25T21:26:15.380956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01793","last_updated":"2020-10-05T05:46:10Z","snapshot_observed_at":"2026-08-12T08:42:33.139142Z","submitted_at":"2020-10-05T05:46:10Z","title":"JSSS: free Japanese speech corpus for summarization and simplification","version":1},"cited_work":{"arxiv_id":"2010.01793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.01793","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Takamichi, S., Komachi, M., Tanji, N., and Saruwatari, H","venue":null,"work_id":"a26e67ee-255c-49f2-9a1c-963bd417bf1f","year":2026},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2010.01793","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:1052161ac78d4e4fd6318d744ba656c4920bdf3a2165d3ef9d48a2936328d0bb","observation_id":"c15dff90-1d12-423e-baa2-7835ea0f993e","resolution":{"observed_at":"2026-05-11T15:41:31.707924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08739","last_updated":"2024-08-16T13:37:20Z","snapshot_observed_at":"2026-08-13T19:18:40.221773Z","submitted_at":"2024-08-16T13:37:20Z","title":"ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale","version":1},"cited_work":{"arxiv_id":"2408.08739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08739","snapshot_observed_at":"2026-07-04T07:49:38.746872Z","title":"ASVspoof 5: Crowdsourced speech data at scale","venue":null,"work_id":"00f9ada8-7f80-449e-95d3-b9f58bfad87a","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2408.08739","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:76bdf4469188ca78b7a6337057a19c34b51688c82f6710ca5fa0178b27c9c368","observation_id":"aa430382-204a-426d-b3c3-a247a26503d3","resolution":{"observed_at":"2026-05-11T15:41:35.345209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07237","last_updated":"2024-06-11T13:16:09Z","snapshot_observed_at":"2026-08-12T23:45:35.107154Z","submitted_at":"2024-06-11T13:16:09Z","title":"CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems","version":1},"cited_work":{"arxiv_id":"2406.07237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07237","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Codecfake: Enhanc- ing anti-spoofing models against deepfake audios from codec-based speech synthesis systems.arXiv preprint arXiv:2406.07237","venue":null,"work_id":"57111da5-121e-4c05-b2ea-8c27e3cb15f1","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2406.07237","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:5dbfdcd3d75d4268d2f1eaf544196d748055795a3bce7d325e410f8982041dd1","observation_id":"756857e7-d796-44cd-9e2a-c0ca260e2418","resolution":{"observed_at":"2026-05-11T15:41:34.406645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06514","last_updated":"2025-01-11T11:15:58Z","snapshot_observed_at":"2026-08-10T23:38:55.781588Z","submitted_at":"2025-01-11T11:15:58Z","title":"Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition","version":1},"cited_work":{"arxiv_id":"2501.06514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06514","snapshot_observed_at":"2026-07-03T03:47:35.575637Z","title":"Neural codec source tracing: Toward comprehensive attribution in open-set condition","venue":null,"work_id":"a6761591-576f-42a0-8a32-6a6810469740","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2501.06514","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:b6468cebc5773622cad1cadaf524b89df4bda90fc94d5a5368986f002b142fc4","observation_id":"0c4fa906-d077-4b9b-9385-a08bd0821cd7","resolution":{"observed_at":"2026-05-11T15:41:32.564889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00537","last_updated":"2021-09-01T16:17:31Z","snapshot_observed_at":"2026-08-13T18:19:06.230363Z","submitted_at":"2021-09-01T16:17:31Z","title":"ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection","version":1},"cited_work":{"arxiv_id":"2109.00537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00537","snapshot_observed_at":"2026-07-04T12:29:52.021660Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection","venue":null,"work_id":"fda9fe31-4af5-4019-b3af-48a642c80b70","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2109.00537","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:9056b6277527a1271075424cb55cbcb0427a3fcc8dc72057a0bf4200f633c8d6","observation_id":"d1459f72-da4a-4128-91d9-16cff074ccbf","resolution":{"observed_at":"2026-05-11T15:41:31.868407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14006","last_updated":"2024-07-19T03:36:48Z","snapshot_observed_at":"2026-08-12T23:19:00.705786Z","submitted_at":"2024-07-19T03:36:48Z","title":"MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2407.14006","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14006","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mscenespeech: A multi-scene speech dataset for expressive speech synthesis.arXiv preprint arXiv:2407.14006","venue":null,"work_id":"a17daa92-ccaf-4eb6-9045-b4b718462ebf","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2407.14006","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:8451ac583f1a6906ceeb012079a628f08ae89576ce4161328bce5913eca37f77","observation_id":"de63e1e9-9ecb-4c86-80fa-fdce143c610e","resolution":{"observed_at":"2026-05-11T15:41:35.279155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-13T19:29:25.057273Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:421cc3514762b5e2e9c18639b4d7768eebb29f66704f8318c33e1c6c648d4f2e","observation_id":"1d174128-92b1-4b5d-90be-656fa86a94bc","resolution":{"observed_at":"2026-05-11T15:41:33.505238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25955","last_updated":"2026-06-22T12:55:18Z","snapshot_observed_at":"2026-08-13T09:10:45.495148Z","submitted_at":"2025-10-29T20:53:12Z","title":"SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations","version":4},"cited_work":{"arxiv_id":"2510.25955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.25955","snapshot_observed_at":"2026-07-04T17:09:58.602413Z","title":"SPEAR: A unified ssl framework for learning speech and audio representations.arXiv preprint arXiv:2510.25955","venue":"eess.AS","work_id":"6b5f07c2-d4aa-4e2b-8435-70737f1335eb","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2510.25955","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:7a7bbf98605bd482411cdeea6a29e69e2ae4a608e44a013870032e612bc75ad9","observation_id":"9df8832f-7b6d-434f-8990-93f145edc78a","resolution":{"observed_at":"2026-06-23T04:13:40.777736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03617","last_updated":"2023-12-16T02:17:19Z","snapshot_observed_at":"2026-08-13T19:43:45.696909Z","submitted_at":"2021-04-08T08:57:13Z","title":"Half-Truth: A Partially Fake Audio Detection Dataset","version":2},"cited_work":{"arxiv_id":"2104.03617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.03617","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Half-truth: A partially fake audio detection dataset.arXiv preprint arXiv:2104.03617","venue":null,"work_id":"efc40a1b-edd5-4f05-b661-68702384f76b","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2104.03617","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e1d58754c1b8a89f5c73e2136831d0b9b40a59fddac8c472325c6688e3e4523c","observation_id":"57bc7879-8a94-460a-82e6-a68a2874a80b","resolution":{"observed_at":"2026-05-11T15:41:32.138168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singfake: Singing voice deepfake detection","venue":null,"work_id":"35cc0df9-c0c1-4a07-b317-71d916ae77ff","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:aa8dca4000fe676e87ec753d66287398456aa8eff85f233b2bf7c62a2b9853c6","observation_id":"9b8e9469-d344-4d12-b3e9-869e0c2e5a80","resolution":{"observed_at":"2026-05-25T21:26:15.378444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio deepfake detection: What has been achieved and what lies ahead.Sensors (Basel, Switzerland), 25(7):1989","venue":null,"work_id":"ad5b8e05-f318-487b-92bb-a0fd5eeb1b7f","year":1989},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:a14e866aa63b3151c7832a06f98f24407a72bec37dfc559e47c545ab23216f9d","observation_id":"18842dae-1a5e-48ea-8bba-30bff6ddf03d","resolution":{"observed_at":"2026-05-25T21:26:15.384022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SVDD 2024: The inaugural singing voice deepfake detection challenge","venue":null,"work_id":"63db02ba-5aeb-4e2c-b9c5-83660d826db8","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:f87cd5f2bfd62f5aba40e6220489272ac06633535c1368e9fad536f3629db74b","observation_id":"dd743721-520f-4299-b43f-758fd58a2cf5","resolution":{"observed_at":"2026-05-25T21:26:15.387024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21597","last_updated":"2026-06-03T17:37:13Z","snapshot_observed_at":"2026-08-04T15:01:24.045051Z","submitted_at":"2025-09-25T21:09:40Z","title":"AUDDT: A Unified Benchmark Toolkit for Audio and Speech Deepfake Detectors","version":2},"cited_work":{"arxiv_id":"2509.21597","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.21597","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Pimentel, A., and Falk, T","venue":null,"work_id":"a303996c-90ae-4136-9b1b-ed6d79604aa3","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2509.21597","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:531c93f2df7a88b45eba5346964d7e11f1b9b7123eacd97f18a95c59f37e4c66","observation_id":"443d723c-b3cb-413d-8d98-66e5d4368898","resolution":{"observed_at":"2026-06-04T02:07:39.638614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"560bb64e-46f5-45f4-b9d1-bee50a621551","year":2020},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:e51b3f6f6c9df0498230c4b676361b8837414d8c9a8fe8fdb9a09ae16851079f","observation_id":"5ccc53a1-bc74-456c-80b1-75dfd457111a","resolution":{"observed_at":"2026-05-25T21:26:15.392964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"all-step","venue":null,"work_id":"4ea085de-a8a8-4d03-b133-a6a2b985049f","year":2020},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:17a3a8f43f5edfe509a0e8c44890a6ad7a8dd0a545aba1e9c9ec0f64d1b40ab2","observation_id":"ed41190a-b2a8-414b-859c-6980c7572207","resolution":{"observed_at":"2026-05-25T21:26:15.375713Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Other Tasks PFSL.For dataset configuration and model inference, we adapt the framework provided by Luong et al","venue":null,"work_id":"e433e567-653b-460f-b556-df37f983ec61","year":2025},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:c432df3cf2c3213e2975c96d7a2e4cbffd4786fe022c2d63e9e7cd32aba32cb0","observation_id":"961a8366-95c9-4244-9868-3a701b2f7757","resolution":{"observed_at":"2026-05-25T21:26:15.390327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A VDD.For this task, we adapt code from the FakeA VCeleb repository2","venue":null,"work_id":"787c6438-2128-43b0-9dc5-e63ce1412bfa","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:3f123098ebde00b48b4f4759dc366b7d130d5754bc56f66f2891f32b5a65f1bb","observation_id":"9c7f63d8-7453-4836-b9d6-95cc554222ad","resolution":{"observed_at":"2026-05-25T21:26:15.401907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bba7e8e5-1351-4346-982d-92bf3fe8bc20","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:da6413ac6e479b972690070a24b08d4f309513c660c0e8c7a825e8eeca1761c2","observation_id":"c2034fe2-0aa4-4feb-b8a1-db9d751822a6","resolution":{"observed_at":"2026-05-25T21:26:15.404444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"preprocessed","venue":null,"work_id":"a880afab-90a1-4823-ae5f-436039b771f7","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:4c0e4ae91227a1859b5acc0ef26ab1102483864030dc9da95378b691f8b73033","observation_id":"cf07b65d-a843-4998-aab0-4a0d012b14e0","resolution":{"observed_at":"2026-05-25T21:26:15.407306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d33a45c7-054a-43cb-8998-f58cf3bb1a27","year":2024},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:1ba30698fe0d60bc2c5c4233d354713e49479a1026cab452be9f6e330aeac057","observation_id":"6704ddd1-53eb-40f8-86b6-04feb069d2e6","resolution":{"observed_at":"2026-05-25T21:26:15.396178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d0260adb-4a08-4f51-956e-f4c6d61b885c","year":2019},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:a5735eb37068775e93f310fdfbb02dfc68ad3e80656e96f2fd6df60776217ddf","observation_id":"3e3e94e6-e8af-4352-84c8-5cb0397b6f33","resolution":{"observed_at":"2026-05-25T21:26:15.398943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Other Experimental Results G.1","venue":null,"work_id":"74218b9a-fbd1-410d-8a71-d5594ea5fe66","year":1934},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:99268a8a5858480cc10a2d7dde9d9b887b7e3bd04f014b19b83f68dc7fc128a0","observation_id":"88836099-047e-4aee-b12a-d881db205f19","resolution":{"observed_at":"2026-05-25T21:26:15.410512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":2,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":6,"verified_exact":27,"verified_fuzzy":19},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2605.00251."}