{"as_of":"2026-08-10T11:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb5b27d0f10c59bd14e793b4feb9c40f65f2a75b429cc2c1683ad92ae9513b65","coverage":[{"denominator":162,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:50:21.172908Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05507/citation-record","integrity":"/paper/2608.05507/integrity","json":"/paper/2608.05507/citation-record.json","paper":"/paper/2608.05507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.827537Z","title":"Busso and R","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.827537Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:09a6d4304f19cd8f2ee3793e6c0ce8cbcab69c2498720470bb7eb25cb2e58841","observation_id":"afdcb53f-4466-4d38-bc83-faf75effdfb7","resolution":{"observed_at":"2026-08-08T11:50:20.827537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.831613Z","title":"Artificial Intelligence Review , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.831613Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:74bc9fa9e4be4c7f44e6ada84c1ed38616dc364b5850a5d237375799bf1d43f1","observation_id":"1ab19ad2-ce5a-40ee-8093-fa743c552777","resolution":{"observed_at":"2026-08-08T11:50:20.831613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10781","last_updated":"2025-09-13T01:58:34Z","snapshot_observed_at":"2026-08-10T00:42:59.661827Z","submitted_at":"2025-09-13T01:58:34Z","title":"Emoanti: audio anti-deepfake with refined emotion-guided representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10781","snapshot_observed_at":"2026-08-08T11:50:20.835476Z","title":"arXiv preprint arXiv:2509.10781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.835476Z"},"links":{"cited_paper":"/paper/2509.10781","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c1103c0e8f5145865d1df4353985571f507081970b9506f027436c67846b2b22","observation_id":"1930ed66-d594-43e3-9065-54099f5db9e9","resolution":{"observed_at":"2026-08-08T11:50:20.835476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.839466Z","title":"Applied intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.839466Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:86ec806880107eff401a0918871d8cd28b2e04a7afcdd60789350021f1471188","observation_id":"55c5f096-0c8f-4a07-a8a2-d3215b0b5e6c","resolution":{"observed_at":"2026-08-08T11:50:20.839466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.843369Z","title":"The 2024 ACM Conference on Fairness, Accountability, and Transparency , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.843369Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:158813214481f0293228d2bd5f7efe5dbd606c8148228b8ed6c8d670b7b819ed","observation_id":"019f9663-167f-41d7-a68a-57425e03528a","resolution":{"observed_at":"2026-08-08T11:50:20.843369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.847029Z","title":"End-to-End anti-spoofing with RawNet2 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.847029Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b39fec486cda538470db1ce01d7f2eb929349a761fc1f4b78713460437e09304","observation_id":"b4a5decc-5f55-4ab1-b4e4-93166d801464","resolution":{"observed_at":"2026-08-08T11:50:20.847029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.850778Z","title":"AASIST: Audio Anti-Spoofing Using Integrated Spectro-Temporal Graph Attention Networks , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.850778Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7e22ceb078b674e4929543664c2231a572e6e9d7c2b3138da08d661df4363a55","observation_id":"c26db90c-c2ab-436b-b362-eef34dd21a37","resolution":{"observed_at":"2026-08-08T11:50:20.850778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:23.740664Z","title":"ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech , journal =","venue":null,"work_id":"2cdc66fe-a4b7-4a55-b09b-c32c88ea4641","year":2019},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.854040Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a04100c9c150ea1505b2345a1ab7a894a47e554433641c95f22d8a025bfb89fe","observation_id":"bf934a49-aa58-4cdd-8b47-163843f32368","resolution":{"observed_at":"2026-08-08T11:50:23.744601Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.857602Z","title":"ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild , year=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.857602Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:79be008be7672e652169e5bcd551c362a86653f4dd9d638d0dcfb3a69947fc8f","observation_id":"1a08421d-12ca-49fe-9f9e-ff1fd95cf0da","resolution":{"observed_at":"2026-08-08T11:50:20.857602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.861212Z","title":"StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.861212Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:e9d90e664dbe1033c0aec181fc410e6bc5d71f7b69174e01d79aea72662699b9","observation_id":"f88db42b-ca2d-4698-86a0-5bea2864037d","resolution":{"observed_at":"2026-08-08T11:50:20.861212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.864623Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.864623Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:1f24b5df29270d8d1a378e499d8353cfb4f29198060aaf778d9f68d5028c5337","observation_id":"c8a34661-f0ed-4251-bf0f-89106415c726","resolution":{"observed_at":"2026-08-08T11:50:20.864623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-08T11:50:20.868085Z","title":"arXiv preprint arXiv:2407.05407 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.868085Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c59c7415fd3d9eb08b19ddec9c8eca17ac151e09dbfa2982d39658d17aae6b67","observation_id":"818c7cc0-5fc2-4b41-b4cd-5e36e02a454a","resolution":{"observed_at":"2026-08-08T11:50:20.868085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08739","last_updated":"2024-08-16T13:37:20Z","snapshot_observed_at":"2026-07-06T19:01:32.237848Z","submitted_at":"2024-08-16T13:37:20Z","title":"ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08739","snapshot_observed_at":"2026-08-08T11:50:20.872203Z","title":"arXiv preprint arXiv:2408.08739 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.872203Z"},"links":{"cited_paper":"/paper/2408.08739","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:835c1c33a14a534b25f956886996417b1f42d99a93661a32232fe5eb1d76627e","observation_id":"28fc5487-e371-4abb-b98a-270c3c419d70","resolution":{"observed_at":"2026-08-08T11:50:20.872203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.875846Z","title":"China National Conference on Chinese Computational Linguistics , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.875846Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:63f9f64806a5a6cdf3164dc6769a3da62e18944fe109dfdfffc43f0d530dd554","observation_id":"e3911ac0-7246-4796-9b28-7b2526882d18","resolution":{"observed_at":"2026-08-08T11:50:20.875846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.879440Z","title":"ADD 2022: the first Audio Deep Synthesis Detection Challenge , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.879440Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7f8da56812ad33fa499a652e52ac1cb3a7547fbd380e608d0137ca89d278a4c9","observation_id":"ed4954ef-7de1-4164-b221-c7f1dca24e96","resolution":{"observed_at":"2026-08-08T11:50:20.879440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-08-08T11:50:20.882735Z","title":"arXiv preprint arXiv:2305.13774 , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.882735Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:be75e1248e83beb97d5236360dda5ec81553062a416cf4ed031c4c5db9af56fe","observation_id":"7a35fe27-8980-450b-92ec-36386e8d5d08","resolution":{"observed_at":"2026-08-08T11:50:20.882735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.886464Z","title":"Training , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.886464Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:183a29427a51b0c9725b29d84ce870f6a9d3a202627e3200354ac9cc52f24516","observation_id":"e8b1f6db-92b2-4192-8b3c-bffe53248ee4","resolution":{"observed_at":"2026-08-08T11:50:20.886464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.889694Z","title":"Seen and Unseen Emotional Style Transfer for Voice Conversion with A New Emotional Speech Dataset , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.889694Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:79409bdd68414cdd11b93981c34f748c256adba91f5772cb7b19356e2d72eb6d","observation_id":"0200fc8b-28fa-4f79-b869-016feba7dd4e","resolution":{"observed_at":"2026-08-08T11:50:20.889694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.893083Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.893083Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:5a2671fdfbb48bad79a1139d0bc7c72a7bf694c28e1ba7c0597abee068fa342e","observation_id":"87ce8e59-4660-4656-9475-30e791b278af","resolution":{"observed_at":"2026-08-08T11:50:20.893083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.896403Z","title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.896403Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:3070fcfc046e36078b1c6296aa11dd34bc870ff50c24e0679ea8b1c832ffc26c","observation_id":"d3c68ad9-6464-45d3-b46a-e07eba8c02b6","resolution":{"observed_at":"2026-08-08T11:50:20.896403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.899689Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.899689Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:9ada036b6d1816d4ba238fecfb682c5bede4117b05fb0526f1cce9d91b4e56af","observation_id":"9a01ef94-a10f-4f14-8c5e-e9d6f9bcdf10","resolution":{"observed_at":"2026-08-08T11:50:20.899689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.903129Z","title":"Development , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.903129Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:53f08030491e04832b6f0dd0f15d0ca24b1810bc36b432e8c20172fa2f02a8a6","observation_id":"9e710910-821c-4118-94de-7370fcd3710f","resolution":{"observed_at":"2026-08-08T11:50:20.903129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.907876Z","title":"Interspeech 2022 , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.907876Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ac6b5e59b48ea3860e6d4b879c74c9c594052171716256c3a5aa5a468900cde9","observation_id":"d23698f6-20cb-42b1-a354-45750f63d41b","resolution":{"observed_at":"2026-08-08T11:50:20.907876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09637","last_updated":"2020-09-21T06:38:19Z","snapshot_observed_at":"2026-08-10T01:51:05.493176Z","submitted_at":"2020-09-21T06:38:19Z","title":"Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09637","snapshot_observed_at":"2026-08-08T11:50:20.911251Z","title":"arXiv preprint arXiv:2009.09637 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.911251Z"},"links":{"cited_paper":"/paper/2009.09637","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7c2c3818108e59a4bd87cef8970ee07a369764e745dac0b05bdccb9ae8499d72","observation_id":"2389d46c-b44e-4b3e-8517-d02227bd7774","resolution":{"observed_at":"2026-08-08T11:50:20.911251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01120","last_updated":"2019-04-01T21:47:00Z","snapshot_observed_at":"2026-08-01T16:03:46.824467Z","submitted_at":"2019-04-01T21:47:00Z","title":"ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01120","snapshot_observed_at":"2026-08-08T11:50:20.914922Z","title":"arXiv preprint arXiv:1904.01120 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.914922Z"},"links":{"cited_paper":"/paper/1904.01120","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b05bb15b03177fe4928e1ff6c557d4abc452d238e0b3872a4e43f8f9c2ea965f","observation_id":"ea63185b-1253-42a7-8f56-bad1552d7a81","resolution":{"observed_at":"2026-08-08T11:50:20.914922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.918662Z","title":"2023 18th International Joint Symposium on Artificial Intelligence and Natural Language Processing (iSAI-NLP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.918662Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:702163a56bcdcfae766742dbcbe762807f170e20e24d5706ec1e70499f50d6bc","observation_id":"c654db24-786a-4d88-bce8-243b1b2c95fb","resolution":{"observed_at":"2026-08-08T11:50:20.918662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09791","last_updated":"2025-09-11T18:51:58Z","snapshot_observed_at":"2026-08-08T06:22:12.517525Z","submitted_at":"2025-09-11T18:51:58Z","title":"The MSP-Podcast Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09791","snapshot_observed_at":"2026-08-08T11:50:20.922023Z","title":"arXiv preprint arXiv:2509.09791 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.922023Z"},"links":{"cited_paper":"/paper/2509.09791","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:cb9b0a6f04521352485e9acc01eda97a35f92441eb4b81154ad998f8026efa6b","observation_id":"7f716022-9104-4dd8-ac8f-6df4a970c680","resolution":{"observed_at":"2026-08-08T11:50:20.922023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.925940Z","title":"EMOQ-TTS: Emotion Intensity Quantization for Fine-Grained Controllable Emotional Text-to-Speech , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.925940Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4e65ec0955dd437e3e7a78782877be95d258727f8a6e47715642d842e9c28d22","observation_id":"b0307f1a-3948-4817-8717-17b5f9225218","resolution":{"observed_at":"2026-08-08T11:50:20.925940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.929217Z","title":"Emodiff: Intensity Controllable Emotional Text-to-Speech with Soft-Label Guidance , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.929217Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:835226f995b986e540fca1c565944077a1bab497c27eefa15468a79070a00557","observation_id":"ea28811f-56b9-4a8b-aa57-19e71db09060","resolution":{"observed_at":"2026-08-08T11:50:20.929217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.932415Z","title":"ED-TTS: Multi-Scale Emotion Modeling Using Cross-Domain Emotion Diarization for Emotional Speech Synthesis , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.932415Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:98cef218c188d6eee7d53bd96eb26667659693376d32ff6425d536d2a49deade","observation_id":"3a8b974c-1034-4827-81c7-f15f416586cf","resolution":{"observed_at":"2026-08-08T11:50:20.932415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.935904Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.935904Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:f2125c7b829c3064819407dfe1d5752cc6bfe93eab0454e2d8a4516bf09c8a7b","observation_id":"82738aa9-2b7e-4661-97ac-f3a1e0d30429","resolution":{"observed_at":"2026-08-08T11:50:20.935904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.939248Z","title":"Advances in Neural Information Processing Systems , editor=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.939248Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:bae946b8ea2796e17f7d5c1f39da19b6af629b63755f44691f607bfe6635b73b","observation_id":"58fdbb6c-6582-4756-bf96-c053cbb258fd","resolution":{"observed_at":"2026-08-08T11:50:20.939248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.942739Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.942739Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:24cc88a354bd9482448b5563df6e11ec3f14e433a623b8d5d6d7288c96c06b9c","observation_id":"7e4b8981-a30e-4f24-9824-85ef9f719a7e","resolution":{"observed_at":"2026-08-08T11:50:20.942739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.945962Z","title":"Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-To-Speech , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.945962Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:900521f9b378c6efc0b8d78b38dc421fbb7463dbe21a2d80e5702c7a8174047d","observation_id":"a35aacef-30fd-46ee-ae1c-892cb3ba56dd","resolution":{"observed_at":"2026-08-08T11:50:20.945962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.949422Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.949422Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:10b5009557af9c8c59fb20727860e1b52959e5a4862f1fda5911cdd49c98ee02","observation_id":"c7b76fa3-b136-44fc-a9b4-9a9a21afd413","resolution":{"observed_at":"2026-08-08T11:50:20.949422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.952770Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.952770Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b327bb9d6ef2f28ac66171b9cb8355cf741c7f904ee00bf3bfeaef6e321ae53a","observation_id":"ade48486-2678-4209-bedd-7f83c578c669","resolution":{"observed_at":"2026-08-08T11:50:20.952770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-07-06T12:41:22.635071Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-08-08T11:50:20.956033Z","title":"arXiv preprint arXiv:2202.12233 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.956033Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:44cb009e18683a48914883aed0b7b394dc731ca7123c262578056429d9d152d9","observation_id":"1f313600-25aa-4c35-a086-c65aceaa60b2","resolution":{"observed_at":"2026-08-08T11:50:20.956033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-08T11:50:20.959680Z","title":"arXiv preprint arXiv:2111.09296 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.959680Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b13b999072a4bfac8baf635861a558b6705c3f0193c4cbfffe3146be6fe170a9","observation_id":"d2c4190e-0f77-431f-9e6a-f25ddb3fb6be","resolution":{"observed_at":"2026-08-08T11:50:20.959680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.963557Z","title":"IEEE Journal of Selected Topics in Signal Processing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.963557Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:f54b9c8ced4a00f6aeee5db6f3946759421ab12ccfb687517ae3a4436558a7cf","observation_id":"2e7cd1c7-3c25-46ba-947e-9c88c05f1deb","resolution":{"observed_at":"2026-08-08T11:50:20.963557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.966883Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.966883Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:652631190a5e17ba695759bacb0d93f06db83c296cdcebe9e51c137b573433d3","observation_id":"02176627-a37f-439d-8343-a71422ec40a7","resolution":{"observed_at":"2026-08-08T11:50:20.966883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.970139Z","title":"IEEE/ACM transactions on audio, speech, and language processing , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.970139Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:75d9fdad02e53b4fc655f418f2d5c7c1acd2b12c46ca31bc4402c5bdd0d2f546","observation_id":"4fea9f74-b5c5-4739-a850-315dff836400","resolution":{"observed_at":"2026-08-08T11:50:20.970139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14726","last_updated":"2025-02-20T16:52:55Z","snapshot_observed_at":"2026-08-07T18:01:26.635694Z","submitted_at":"2025-02-20T16:52:55Z","title":"Pitch Imperfect: Detecting Audio Deepfakes Through Acoustic Prosodic Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14726","snapshot_observed_at":"2026-08-08T11:50:20.973529Z","title":"arXiv preprint arXiv:2502.14726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.973529Z"},"links":{"cited_paper":"/paper/2502.14726","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:853ad3b99dae567b62f4b0c6117481b9358d80c76091149400fc18f06818cbcb","observation_id":"e2c06744-c406-4c70-82d6-e12bb10bd05d","resolution":{"observed_at":"2026-08-08T11:50:20.973529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.977007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.977007Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:df659ef7ef149a9107f619db98b02b02c387b56ef9d73d1db55f4f9c9fe2464a","observation_id":"d01dc710-0239-4350-92f6-8b6a4f2a223b","resolution":{"observed_at":"2026-08-08T11:50:20.977007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.980204Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.980204Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b5d3d960c6ea117e818e31c7279f63445dc5a9f7c3c77408afb4222b77d976cc","observation_id":"6b2e64dd-1431-4866-9b75-9db8688c542e","resolution":{"observed_at":"2026-08-08T11:50:20.980204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.983482Z","title":"EURASIP Journal on Audio, Speech, and Music Processing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.983482Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c11301dcf152cea3c1fc77ad939868aec3117f130f4a81c666dbc768094f01a1","observation_id":"1da9739a-fb15-460e-bfb4-6ce5bc3626f4","resolution":{"observed_at":"2026-08-08T11:50:20.983482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19197","last_updated":"2025-04-27T11:22:21Z","snapshot_observed_at":"2026-08-07T15:58:51.482040Z","submitted_at":"2025-04-27T11:22:21Z","title":"Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements","version":1},"cited_work":{"arxiv_id":"2504.19197","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.19197","snapshot_observed_at":"2026-08-08T11:50:23.464466Z","title":"Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements","venue":"cs.SD","work_id":"97363b82-c0a0-4d8e-af8e-3cd0c6ba253f","year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.986817Z"},"links":{"cited_paper":"/paper/2504.19197","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d2a4ddfdd1c74ed192db32a63433e290a17874e27d9acffd3322489125ea9387","observation_id":"b77b17f6-5d37-4c6e-aec1-b460840ffd0d","resolution":{"observed_at":"2026-08-08T11:50:23.468649Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.990676Z","title":"Frontiers in signal processing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.990676Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:a40ffdd17b472c764587d72f9d7dd28e03aebeb36610f80cf39a8d7047ea07de","observation_id":"2c2cb1bb-e909-4de2-ae84-3a8c5e7cb277","resolution":{"observed_at":"2026-08-08T11:50:20.990676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.993945Z","title":"IEICE TRANSACTIONS on Information and Systems , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.993945Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:fe020e30b6282e2a67d27eddeb5aba105404eef5dc2878fd1490670bc26bd310","observation_id":"1227421f-4ffa-484d-b0f3-e7bdb663b156","resolution":{"observed_at":"2026-08-08T11:50:20.993945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:20.997227Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:20.997227Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:cd4cb11e2304c0e8b27594b07bf092de2d4a308c98b29213d3311bc0c206669f","observation_id":"e2c789b3-8842-454a-b68b-35b689de0a0f","resolution":{"observed_at":"2026-08-08T11:50:20.997227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.000532Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.000532Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:858ac810367aa41e8907171f98226e5acd0eb8e9c788721f9b5b426a08a198f7","observation_id":"ee6cb616-aebc-4b3c-b1f8-d5c71a430fe0","resolution":{"observed_at":"2026-08-08T11:50:21.000532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07402","last_updated":"2022-12-13T14:12:02Z","snapshot_observed_at":"2026-08-05T21:50:11.152608Z","submitted_at":"2021-11-14T18:16:42Z","title":"Textless Speech Emotion Conversion using Discrete and Decomposed Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07402","snapshot_observed_at":"2026-08-08T11:50:21.003985Z","title":"arXiv preprint arXiv:2111.07402 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.003985Z"},"links":{"cited_paper":"/paper/2111.07402","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:70130972fc942dc2c690ae187205ef9ddec86b7067c88abcf834fbd8cd52d97e","observation_id":"20f2c225-b11c-43a8-babd-4ee563595883","resolution":{"observed_at":"2026-08-08T11:50:21.003985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.007684Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.007684Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4249874e3ed2d00f4d7db38cfaa5f31571fa44941a0f2818159522981e37a72a","observation_id":"39c3c457-4d4a-436f-a5e4-d709c9878641","resolution":{"observed_at":"2026-08-08T11:50:21.007684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.011412Z","title":"XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.011412Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:94d27b798ee80763475eb276a8b6f5f4cda4397e9a2d31f7ebdeab7c2b42677b","observation_id":"dc272b26-3def-4d78-900a-ede1c3006f45","resolution":{"observed_at":"2026-08-08T11:50:21.011412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.014796Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.014796Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:20e1928801a0653dcaa3c12c2447a9bb4906a2151c111b32cff1b16580306d03","observation_id":"db7777d0-cbbd-4479-9410-af00f3c8bc8b","resolution":{"observed_at":"2026-08-08T11:50:21.014796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.018368Z","title":"Proceedings of the 15th Biannual Conference of the Italian SIGCHI Chapter , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.018368Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:78e269b497dfb3805e21ba5885d02cd4553a204df807aa902067529d967f086b","observation_id":"e4c4185c-e4c5-40ae-bb9a-e47dd383ea4b","resolution":{"observed_at":"2026-08-08T11:50:21.018368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.021912Z","title":"Better Be Computer or I'm Dumb","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.021912Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c1ac75ade7b21bd122030fcb7e557b74808b26ddc810c3544b9081ca663c8b49","observation_id":"933159c5-26ee-42e8-8216-6e5711ffc863","resolution":{"observed_at":"2026-08-08T11:50:21.021912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.025934Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.025934Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4f24148ab3fe454a439cc95751bf656ac7015f2b0a63f796b5b53a0ad66898b4","observation_id":"cc5022a4-3a9f-4425-905f-cd14ce7b8905","resolution":{"observed_at":"2026-08-08T11:50:21.025934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.029353Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.029353Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8183db179ef5e8afb44b14ff32f5c1efa5541993957f3a27468765c5c12da47e","observation_id":"c84efbff-5a9d-4898-b740-698915415949","resolution":{"observed_at":"2026-08-08T11:50:21.029353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.032707Z","title":"ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.032707Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:438ddbbb46266747162b057c273194e537ace88b6575af1440d1ff63b639e999","observation_id":"ca4d43e5-c0e6-42fa-819d-fe41b83375d3","resolution":{"observed_at":"2026-08-08T11:50:21.032707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.036159Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.036159Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:55741c83b869ce2101b132d28c86b6100b9c0fdb74f83649172bc82b712dc6d5","observation_id":"49f0a89d-9841-48d1-85a2-08efdc5ad558","resolution":{"observed_at":"2026-08-08T11:50:21.036159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.039601Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.039601Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:132baccfddf465020ab232ec8791212e087d5679a2988cef461604425cd15156","observation_id":"81de6bbb-4793-4952-8fc1-81654ac65f22","resolution":{"observed_at":"2026-08-08T11:50:21.039601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.043246Z","title":", author=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.043246Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:fe08ba1b726e165d5b5e785db1b5f18e92178b5889644fda4a5f2dbf91e6b7b2","observation_id":"7e2a0e17-847f-4f6c-b983-80776e1b1a14","resolution":{"observed_at":"2026-08-08T11:50:21.043246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.047014Z","title":"National Science Review , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.047014Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:617f780cdf70a96c4c0961799a19b5107fc705cd183ff846acf9eef1187597b2","observation_id":"6a513489-d8aa-4a62-b4e3-8951d7451e57","resolution":{"observed_at":"2026-08-08T11:50:21.047014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"cited_work":{"arxiv_id":"2509.08470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.08470","snapshot_observed_at":"2026-08-08T11:50:23.439128Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","venue":"eess.AS","work_id":"51d61c7d-fa55-446f-9ab4-1d2492441c12","year":2025},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.050441Z"},"links":{"cited_paper":"/paper/2509.08470","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:21446c2a93a97555054bd44bd039e607c40c7f1fa1a81e8a164ed9022894127d","observation_id":"7ae02a56-13cd-4060-b69f-8422066dd73c","resolution":{"observed_at":"2026-08-08T11:50:23.442986Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.054029Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.054029Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:1c6d544ec66f07206317a9dfddd28dc55d5d9582d6f355ec53fb65dc39fb81e1","observation_id":"e2505c97-f69b-4ee7-9973-2bab71d4adec","resolution":{"observed_at":"2026-08-08T11:50:21.054029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-10T04:10:43.257455Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-08T11:50:21.057378Z","title":"arXiv preprint arXiv:1412.3555 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.057378Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0afc9300c004d0f703948c00357074b9af266ae75e74495dc4ced8ddc4817e0a","observation_id":"16dee11b-68fe-4210-9820-dd89a9ce6aea","resolution":{"observed_at":"2026-08-08T11:50:21.057378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.060759Z","title":"2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.060759Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:24d3d0ca8d4e4a4ae6a9f84a60de073452e0abab076bacfb8ee248a69619b1d8","observation_id":"dc0b567b-d012-4b43-a87c-6dd78c911155","resolution":{"observed_at":"2026-08-08T11:50:21.060759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.064017Z","title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.064017Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c89593577a2422b50258d52da96b3977a6e6c55686015ffeb9ae95a32184dd48","observation_id":"e0027e1b-e32c-4449-81ca-b5ad6fd64d4d","resolution":{"observed_at":"2026-08-08T11:50:21.064017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.067212Z","title":"Proceedings of the 31st ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.067212Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b45832155816b0383ffdfea881bf7ed7b832e8dec4fa0a3d848f1af9f832f874","observation_id":"0a3cac74-4902-4a2e-a732-eefab1a784bd","resolution":{"observed_at":"2026-08-08T11:50:21.067212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.070396Z","title":"IEEE Transactions on Information Forensics and Security , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.070396Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:d33c7028eb53407c0d920849c9715794667c5c246ffe4c03081c231c3ede295c","observation_id":"5de3e80a-8fdc-4edf-9520-b28e52cf96b3","resolution":{"observed_at":"2026-08-08T11:50:21.070396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.074073Z","title":"arXiv preprint arXiv:2509.21676 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.074073Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c7bbb80826a3dc847aa074095f764b2c6167de2b2dd2d25c42de3cd13790b2ba","observation_id":"76361c58-ab90-4a79-b5c4-cfb56a354bc0","resolution":{"observed_at":"2026-08-08T11:50:21.074073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.077413Z","title":"IEEE Transactions on Affective Computing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.077413Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:34a3dc3b269b8fbbfda11aaf34670e495a1632193cf48184a5a1e6adeed4783e","observation_id":"f807bfde-35f1-4d09-a200-1f4069d18e35","resolution":{"observed_at":"2026-08-08T11:50:21.077413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.080569Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.080569Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:4c17bea8e65a8e48cb4e530a8ce5d5de9f64a40b02a4c58bececed29e67948d4","observation_id":"44db2902-c483-4562-88c7-d331f7cef6b0","resolution":{"observed_at":"2026-08-08T11:50:21.080569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04693","last_updated":"2023-11-08T14:02:53Z","snapshot_observed_at":"2026-08-10T05:39:33.806600Z","submitted_at":"2023-11-08T14:02:53Z","title":"Diff-HierVC: Diffusion-based Hierarchical Voice Conversion with Robust Pitch Generation and Masked Prior for Zero-shot Speaker Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04693","snapshot_observed_at":"2026-08-08T11:50:21.083895Z","title":"arXiv preprint arXiv:2311.04693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.083895Z"},"links":{"cited_paper":"/paper/2311.04693","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:6ce271be1a55b369ba6a200b9e0f153e8754258d9fe833eede461fac418e2809","observation_id":"72929826-c271-4bac-8edd-9ec6e3cd5228","resolution":{"observed_at":"2026-08-08T11:50:21.083895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.087492Z","title":"2024 IEEE Spoken Language Technology Workshop (SLT) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.087492Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c68123a04282c16034b705764146a3277658a571e84e1c3bf8dda0d516e6deeb","observation_id":"ba79faa9-3c2e-41ac-8c00-667ad145961e","resolution":{"observed_at":"2026-08-08T11:50:21.087492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.090834Z","title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.090834Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:526625cc6d465666bf07d09ce30739c7d2ce09bc1512d3e77f3c826130b02aea","observation_id":"b2ce0d57-f22c-4409-a0ec-d080dd878a35","resolution":{"observed_at":"2026-08-08T11:50:21.090834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.094029Z","title":"Language, Cognition and Neuroscience , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.094029Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c78fced52fc5841ac8bc9c643c4ce33bb27ef4999d32ddc84dbcd7ce5a811851","observation_id":"f36e7878-8a7f-4e36-a351-a1a85883d06d","resolution":{"observed_at":"2026-08-08T11:50:21.094029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.097212Z","title":"Studies in second language acquisition , volume=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.097212Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:31e9514a65247814343c02acc5fec3642a30cbcc44c923efc8f652d1f58fe3bc","observation_id":"2a6321b1-99c5-447c-870f-75f69c387f81","resolution":{"observed_at":"2026-08-08T11:50:21.097212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.100898Z","title":"and Li, Haizhou , journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.100898Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8ed972e1279441f6116c56dfe65d7237214eccccfec51dee407a40615ff5d7a8","observation_id":"a0c87b74-1e1d-48ca-8f71-fa617158e13b","resolution":{"observed_at":"2026-08-08T11:50:21.100898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.104204Z","title":"Librispeech: An ASR corpus based on public domain audio books , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.104204Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8c7741eeac9bcc5a4dc40f4fe0153976eb95adacfa5d66b289c3d0ebd5e9323a","observation_id":"73da0aa7-013d-4754-af58-b234018319a4","resolution":{"observed_at":"2026-08-08T11:50:21.104204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.107493Z","title":"International Conference on Pattern Recognition , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.107493Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:44931b71db2af1a610c4342028420826949f103410b5e8de2e21cc4b99a39be0","observation_id":"06b115c3-1103-4309-97cf-00dc96bdafb0","resolution":{"observed_at":"2026-08-08T11:50:21.107493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.110585Z","title":"ICASSP 2022-2022 IEEE international conference on acoustics, speech and signal processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.110585Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:1749525c43068861d40d4aa252686ac320af51a1246559acc2197ad39ef27834","observation_id":"4f06e403-81fe-453b-a244-ec3ad0559a37","resolution":{"observed_at":"2026-08-08T11:50:21.110585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.113860Z","title":"2020 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.113860Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:174a1ac9351e4a7fd03fdbc0c4dcbe9d27f6627a0f31b36557eb591995d4c7ba","observation_id":"d89e11c8-dec4-4fb7-90c0-a14c29cfa1c9","resolution":{"observed_at":"2026-08-08T11:50:21.113860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.117276Z","title":"METTS: Multilingual Emotional Text-to-Speech by Cross-Speaker and Cross-Lingual Emotion Transfer , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.117276Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7849f32db75a01628449f9ca3883c514a830bd399a1febc4b0924f4a4402c3b1","observation_id":"0093ee55-cb08-44f2-84b0-989406ec074c","resolution":{"observed_at":"2026-08-08T11:50:21.117276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00186","last_updated":"2025-08-29T18:37:57Z","snapshot_observed_at":"2026-08-07T21:38:02.692073Z","submitted_at":"2025-08-29T18:37:57Z","title":"Generalizable Audio Spoofing Detection using Non-Semantic Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00186","snapshot_observed_at":"2026-08-08T11:50:21.120714Z","title":"arXiv preprint arXiv:2509.00186 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.120714Z"},"links":{"cited_paper":"/paper/2509.00186","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:256ccfce922e636bf1d633e8de3b1c502842a3222427c5868d1b14a529d65315","observation_id":"d3aa8b9d-dd17-4099-b745-ff8498d19f03","resolution":{"observed_at":"2026-08-08T11:50:21.120714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.124312Z","title":"IEEE Transactions on Affective Computing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.124312Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:da14af6fef4268001875a33684dcea7cd8f6d1fdcfd64d270172d8e0716f2e5d","observation_id":"de3d97ca-3d60-43da-afcb-a4c14f2dcade","resolution":{"observed_at":"2026-08-08T11:50:21.124312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.127824Z","title":"2024 International Joint Conference on Neural Networks (IJCNN) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.127824Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:25253ecb8aa8a8f8a30909686aea498ce04ff515790d76406dba97d1a0657c46","observation_id":"7dec294c-8945-4ec9-9d5d-7d705447b78b","resolution":{"observed_at":"2026-08-08T11:50:21.127824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.06422","last_updated":"2020-04-19T13:23:20Z","snapshot_observed_at":"2026-07-06T09:12:13.006707Z","submitted_at":"2020-04-14T11:16:10Z","title":"An explainability study of the constant Q cepstral coefficient spoofing countermeasure for automatic speaker verification","version":3},"cited_work":{"arxiv_id":"2004.06422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.06422","snapshot_observed_at":"2026-08-08T11:50:23.186525Z","title":"An explainability study of the constant Q cepstral coefficient spoofing countermeasure for automatic speaker verification","venue":"eess.AS","work_id":"a96e40e2-0a36-46fa-8103-24dc42cb646c","year":2020},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.131272Z"},"links":{"cited_paper":"/paper/2004.06422","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8e989f444e7320789c3ffd65931ae3b37f3f1b3cf77d82729d2185c04c43fef8","observation_id":"d613ccc7-39bb-413c-9efa-702eee1fbc48","resolution":{"observed_at":"2026-08-08T11:50:23.191094Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.134870Z","title":"EURASIP Journal on Information Security , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.134870Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:eba77a157639b1207e35cafb97270fac11983647294232cd09178ac72c59624c","observation_id":"71897323-4303-459a-9943-418dd541a561","resolution":{"observed_at":"2026-08-08T11:50:21.134870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.138353Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.138353Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ad344d51715e94f8873a095db41b57605823f9e6a931ecd4caff8b5ce62a6dd5","observation_id":"252754f3-e96b-4bcc-8f07-8538e7a122ec","resolution":{"observed_at":"2026-08-08T11:50:21.138353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12914","last_updated":"2021-09-28T09:06:33Z","snapshot_observed_at":"2026-07-06T11:22:29.069903Z","submitted_at":"2021-06-23T08:28:59Z","title":"Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12914","snapshot_observed_at":"2026-08-08T11:50:21.141690Z","title":"arXiv preprint arXiv:2106.12914 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.141690Z"},"links":{"cited_paper":"/paper/2106.12914","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:b170690b92717803818367b426a8653dbd45fe8e32c5e1d6c1e6b001f4dd135f","observation_id":"7631c976-57bd-4421-9c04-22fa68bd1068","resolution":{"observed_at":"2026-08-08T11:50:21.141690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.145361Z","title":"Feature Genuinization based Residual Squeeze-and-Excitation for Audio Anti-Spoofing in Sound AI , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.145361Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:f99e6ce142d7a69d9b719f75a571c4c828dbd1884dc1743bcfc8f3512a8b8269","observation_id":"48fc5548-461b-4853-8d7c-c4fb96f38b51","resolution":{"observed_at":"2026-08-08T11:50:21.145361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.148828Z","title":"PloS one , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.148828Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:f37af8f04ebccd49b87e5f05a3388742a836882310f3ffe13ecfefe192291c7e","observation_id":"7c295709-7373-4fa2-b5d3-e36e48552381","resolution":{"observed_at":"2026-08-08T11:50:21.148828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.152290Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.152290Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:20a3824a0743d1ba43346b217012cabe3bf29b325eb7b1afa74a261cb022f945","observation_id":"6f504cc9-acf2-4c89-b7e6-f5f7f103c7b9","resolution":{"observed_at":"2026-08-08T11:50:21.152290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-08T11:50:21.155761Z","title":"arXiv preprint arXiv:2406.04904 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.155761Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:ecce6ea8af6e3e5e64c5e9b3e19fd64a18089851d6d55b54d47217c069384443","observation_id":"93d279d8-29c1-4fd5-afc8-1017556a9f8e","resolution":{"observed_at":"2026-08-08T11:50:21.155761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.159501Z","title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.159501Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:1825260b249a6768dac5e54ccd809236d756ab8231bf57990551c80aa36d7f8f","observation_id":"2bdfa3ae-4109-4c4e-8f7a-a6a0911ac7f5","resolution":{"observed_at":"2026-08-08T11:50:21.159501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10394","last_updated":"2021-07-23T01:08:09Z","snapshot_observed_at":"2026-07-06T11:31:23.057674Z","submitted_at":"2021-07-21T23:44:17Z","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10394","snapshot_observed_at":"2026-08-08T11:50:21.162778Z","title":"arXiv preprint arXiv:2107.10394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.162778Z"},"links":{"cited_paper":"/paper/2107.10394","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:7ac8d5605a5971fe61bdde97ed113a1fc057daab42442fa91cbc675d18a416c9","observation_id":"2984661d-20a6-422c-b1f0-fd2cc2e27884","resolution":{"observed_at":"2026-08-08T11:50:21.162778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-10T09:42:49.853165Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-08T11:50:21.166263Z","title":"arXiv preprint arXiv:2109.13821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.166263Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:c180a7732c7541ee57babf1aefe9846cb8e0aa2f3166c64f6d0a6bdbc27cddb0","observation_id":"07650bfa-c611-42d6-88ef-957cae3bd642","resolution":{"observed_at":"2026-08-08T11:50:21.166263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.169709Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.169709Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:0c8bd05b717d500bb9a1d3821374dbf5d1bff5d3adb91b0c061c23fb81c71e75","observation_id":"39d2a617-78dc-4f9e-8bed-58ab947bd55b","resolution":{"observed_at":"2026-08-08T11:50:21.169709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:50:21.172908Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.172908Z"},"links":{"citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:8f5af8841fef809e4a5aa285f8ae73d8dc709ba4706bd5f1f86607159bb877e6","observation_id":"7a701a40-187a-4f17-9826-4d7d4ffdc233","resolution":{"observed_at":"2026-08-08T11:50:21.172908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":96,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":162},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 162 outbound references and 0 inbound Pith citation observations for arXiv:2608.05507."}