{"as_of":"2026-08-09T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7b52891333bdf81e252dd2a15483e598d21c7b05ffcee097344b041db5b1ebb","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T10:28:23.687225Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28351/citation-record","integrity":"/paper/2607.28351/integrity","json":"/paper/2607.28351/citation-record.json","paper":"/paper/2607.28351"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-08-07T17:29:40.662418Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-07-31T10:28:21.466792Z","title":"Harder or different? understanding generalization of audio deepfake detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.466792Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:03f9c6a5652a7743d111bd74a03bcd470354ec99dd58bffbd8d204e15e640932","observation_id":"1e544df8-f8d4-48d9-84d8-45e25a441cc6","resolution":{"observed_at":"2026-07-31T10:28:21.466792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.768535Z","title":"Does audio deepfake detection generalize?arXiv preprint arXiv:2203.16263,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.768535Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:7c657d061dca87f9c822b3b67d497f9a39318b59eeda8ebb12adb2fea0915fc4","observation_id":"be4d2081-8dab-48cd-bd07-7774e5a06a7d","resolution":{"observed_at":"2026-07-31T10:28:21.768535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.828061Z","title":"Asvspoof 5: crowdsourced speech data, deepfakes, and adversarial attacks at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.828061Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:94a55c7cb4d784d7679cd321a345f4bdc0604a7177744eb7d2b75faae271a1f3","observation_id":"9b781278-fb42-44c0-9271-5f29fc3fd377","resolution":{"observed_at":"2026-07-31T10:28:21.828061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.938096Z","title":"Light convolutional neural network with feature genuinization for detection of synthetic speech attacks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.938096Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:5a3e195acb53716daaf20c25a65d37d15829ec38c2894f855c4db0aa2b68a681","observation_id":"90bbc901-57b5-4094-af2c-1cfb1db88011","resolution":{"observed_at":"2026-07-31T10:28:21.938096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.950262Z","title":"Replay and synthetic speech detection with res2net architecture","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.950262Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:ee5636881002977ee881f9c012228c40b0d2a19319bc2776cbc97555453da2a9","observation_id":"f1cad2b4-db5c-4e32-8bfc-3748387ebee5","resolution":{"observed_at":"2026-07-31T10:28:21.950262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.014498Z","title":"End-to-end anti-spoofing with rawnet2","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.014498Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:edf96bcceb2f9b48681df8fbaeefdce90868cfe57248086f825c7ce35d5ffcdd","observation_id":"beff54a8-2b33-4293-a96b-632ff7b317bf","resolution":{"observed_at":"2026-07-31T10:28:22.014498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-07-31T10:28:22.087327Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale.arXiv preprint arXiv:2111.09296,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.087327Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:153278f6c99577335a333a9bb4d629928265a4b24e65973ae6325a2bdadbb53d","observation_id":"46196a50-20d5-4b09-b76d-b2dd78425e91","resolution":{"observed_at":"2026-07-31T10:28:22.087327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.148358Z","title":"Mixture of experts fusion for fake audio detection using frozen wav2vec 2.0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.148358Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:44e0ba2cbdf0127d7bb52173c7283e42e79df2339ef50e2d0ed7bf032928c0c4","observation_id":"4f3beb0b-6a81-41c0-8837-d1af39921367","resolution":{"observed_at":"2026-07-31T10:28:22.148358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17376","last_updated":"2024-06-25T08:50:43Z","snapshot_observed_at":"2026-08-09T01:00:21.219903Z","submitted_at":"2024-06-25T08:50:43Z","title":"Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17376","snapshot_observed_at":"2026-07-31T10:28:22.248260Z","title":"Temporal-channel modeling in multi-head self-attention for synthetic speech detection.arXiv preprint arXiv:2406.17376,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.248260Z"},"links":{"cited_paper":"/paper/2406.17376","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d96ad2439e4caae7cbdb0455e30d942773ca56a43c6601d41ae599bc1a806ce5","observation_id":"f1d57647-b9c5-4509-8c87-b1b51aeceaf3","resolution":{"observed_at":"2026-07-31T10:28:22.248260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.307614Z","title":"Frame-level temporal difference learning for partial deepfake speech detection.IEEE Signal Processing Letters, 2025b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.307614Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:d0680a777fd3844c6f06d3941f67ba4c527f8f8d20bb510b0acb3684228eab28","observation_id":"5534c589-bbc2-4ebb-a20c-2669033a82ce","resolution":{"observed_at":"2026-07-31T10:28:22.307614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.380736Z","title":"Leveraging mixture of experts for improved speech deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.380736Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:0e6f97468b9dc3a57f0d3eda3768c4758937f84683e8c8bf699198134bcde3e2","observation_id":"8fff0a9b-4906-4970-93c3-2845da5e2e9b","resolution":{"observed_at":"2026-07-31T10:28:22.380736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09175","last_updated":"2025-09-11T06:18:29Z","snapshot_observed_at":"2026-08-06T15:48:58.256012Z","submitted_at":"2025-09-11T06:18:29Z","title":"MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09175","snapshot_observed_at":"2026-07-31T10:28:22.453820Z","title":"Molex: Mixture of lora experts in speech self-supervised models for audio deepfake detection.arXiv preprint arXiv:2509.09175,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.453820Z"},"links":{"cited_paper":"/paper/2509.09175","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:6f00fdd36b6314613b02f04fc3238b2144c0ea4efe24ac14552b1626f0ee4c45","observation_id":"36d40298-5761-4e16-a2be-ed767dca83ea","resolution":{"observed_at":"2026-07-31T10:28:22.453820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.514287Z","title":"Rawboost: A raw data boosting and augmentation method applied to automatic speaker verification anti-spoofing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.514287Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:a7a015fb88ab5e044625e9dfda07a1ecba808c7b954ab3fa9fe7d63464447bb2","observation_id":"c2c2693f-96fe-4dbd-8842-eca570cb1d9a","resolution":{"observed_at":"2026-07-31T10:28:22.514287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.579124Z","title":"A data-centric approach to generalizable speech deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.579124Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:fcdb5581b8fa162a5031af686c833c824e60d9abb14ace8b88eb67eb8636c8d4","observation_id":"bc8c7fe9-3ce2-443e-ba98-cde4596bb4e3","resolution":{"observed_at":"2026-07-31T10:28:22.579124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.645887Z","title":"Generalizable audio deepfake detection via latent space refinement and augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.645887Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:cf7fc83a92b0ab2f3444ffaf1206d2315bc63f2295623514d44183ffa5a3f1d2","observation_id":"effa4449-a4cd-4e14-8eb8-58e02651b4f0","resolution":{"observed_at":"2026-07-31T10:28:22.645887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.682452Z","title":"Generalizable speech deepfake detection via meta-learned lora","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.682452Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:580893a77b2848c64f143dd782e202e0eeaeb652138bc64d39cd100d6a477641","observation_id":"d3e5bb99-7b3a-436e-aa05-2b31de3e1279","resolution":{"observed_at":"2026-07-31T10:28:22.682452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.779079Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.779079Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:167fd7ae6a9920ce0ffbd013d980b15ca3686133aa810168c332b19fce03a996","observation_id":"6ac7f324-7ed4-4b95-aa6f-491c413728eb","resolution":{"observed_at":"2026-07-31T10:28:22.779079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10963","last_updated":"2019-02-25T01:44:06Z","snapshot_observed_at":"2026-08-02T00:52:09.236237Z","submitted_at":"2018-03-29T08:45:55Z","title":"Attentive Statistics Pooling for Deep Speaker Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10963","snapshot_observed_at":"2026-07-31T10:28:22.841215Z","title":"Attentive statistics pooling for deep speaker embedding.arXiv preprint arXiv:1803.10963,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.841215Z"},"links":{"cited_paper":"/paper/1803.10963","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:c6537c250c31eaf32e712173f9474565c090d7b419648145622c61c575fe3f47","observation_id":"c3de67fd-f113-4190-8cdc-5c70c93268ed","resolution":{"observed_at":"2026-07-31T10:28:22.841215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:22.984927Z","title":"Replay attacks against audio deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.984927Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:99f8d23645726f95ea0bf46b75a2e8bf87ab32d637af0efafdb6c0a7e35813aa","observation_id":"22eb84af-bf57-43a6-ba69-36d91ada68c9","resolution":{"observed_at":"2026-07-31T10:28:22.984927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-31T10:28:23.043310Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.043310Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:5da5ad9ad9ea167a47113702818ed63359cf7b17504ba1647d1b00682b5d11e3","observation_id":"7f9b7f3b-fe35-4c58-8aef-be0e603c8e3f","resolution":{"observed_at":"2026-07-31T10:28:23.043310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-31T10:28:23.121360Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.121360Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:efb2fbac40e84a1d5f994a9645d93fc94848f9b50abcfd7f1f3f8ea79ef26e01","observation_id":"4ec5937e-80d3-493e-a287-688527d91673","resolution":{"observed_at":"2026-07-31T10:28:23.121360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.186106Z","title":"Cn-celeb: a challenging chinese speaker recognition dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.186106Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:f94f6dbc3b9ceb272b77a59db6668364e11b7e964430f3d38e569960f86b01c9","observation_id":"7c8be08c-477e-4554-b9ec-6660e6d78e02","resolution":{"observed_at":"2026-07-31T10:28:23.186106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09204","last_updated":"2025-09-11T07:20:18Z","snapshot_observed_at":"2026-08-09T00:59:18.138223Z","submitted_at":"2025-09-11T07:20:18Z","title":"Bona fide Cross Testing Reveals Weak Spot in Audio Deepfake Detection Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09204","snapshot_observed_at":"2026-07-31T10:28:23.243141Z","title":"Bona fide cross testing reveals weak spot in audio deepfake detection systems.arXiv preprint arXiv:2509.09204,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.243141Z"},"links":{"cited_paper":"/paper/2509.09204","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:f8de06c923c2fd71b1501de809fa17d864f41f4a336b195c32306aa2a2f1af2d","observation_id":"bc341901-0631-4f9d-9ce5-1309c2066c54","resolution":{"observed_at":"2026-07-31T10:28:23.243141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.349214Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.349214Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:0c6ff968772069f947c733cf4d59e1f612f782d1347be8db883dadc6f9059566","observation_id":"44e6ca35-da5a-45cf-8abb-0765a465e3f1","resolution":{"observed_at":"2026-07-31T10:28:23.349214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-31T10:28:23.427413Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.427413Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:42f6e8259c715c3f83c12bc4d51e480f54e14ab4113a83ad17f65902c9cdfc80","observation_id":"fa394a0c-ae31-4537-a500-88ae04bc13c4","resolution":{"observed_at":"2026-07-31T10:28:23.427413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13930","last_updated":"2025-05-20T04:52:59Z","snapshot_observed_at":"2026-08-07T15:42:21.778161Z","submitted_at":"2025-05-20T04:52:59Z","title":"BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13930","snapshot_observed_at":"2026-07-31T10:28:23.484198Z","title":"Bicrossmamba-st: speech deepfake detection with bidirectional mamba spectro-temporal cross-attention.arXiv preprint arXiv:2505.13930,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.484198Z"},"links":{"cited_paper":"/paper/2505.13930","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:6e7c5e6f2bbba2c75e40e789ae4e5d0f532588bac9eb9c3b0c672d0bde79a2cc","observation_id":"6f429dc8-6d58-4039-a3d3-efdb02aeaadd","resolution":{"observed_at":"2026-07-31T10:28:23.484198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-07-06T12:41:22.635071Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-07-31T10:28:23.550257Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation.arXiv preprint arXiv:2202.12233, 2022b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.550257Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:867c17346e9ad2bc6e31bc5bbbb002a02c839eed1cff4e670efecf87d9594b07","observation_id":"4fee6289-b8b6-45a4-8510-182ba23d758e","resolution":{"observed_at":"2026-07-31T10:28:23.550257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.600331Z","title":"Exploring generalization to unseen audio data for spoofing: Insights from ssl models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.600331Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:53fef1e6de2f9686b0ed19d6da8f694019ca1f125fbe8c21e5034fc5346cfc6e","observation_id":"766e22e8-d789-4721-a28c-2178484feb27","resolution":{"observed_at":"2026-07-31T10:28:23.600331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12710","last_updated":"2021-08-23T17:06:53Z","snapshot_observed_at":"2026-07-06T11:32:54.446325Z","submitted_at":"2021-07-27T10:11:41Z","title":"End-to-End Spectro-Temporal Graph Attention Networks for Speaker Verification Anti-Spoofing and Speech Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.12710","snapshot_observed_at":"2026-07-31T10:28:23.629281Z","title":"End-to-end spectro-temporal graph attention networks for speaker verification anti-spoofing and speech deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.629281Z"},"links":{"cited_paper":"/paper/2107.12710","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:a5ad6b870870dd0fa6ce0f1f6596b5ad29f0a78a5b703e388be0b5bbb2ce419f","observation_id":"71c8f231-7d39-4b63-b2d0-808f3d44cdf5","resolution":{"observed_at":"2026-07-31T10:28:23.629281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:23.687225Z","title":"Teffic-Audio achieves the best pooled ACC and pooled F1-score among the listed systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.687225Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:dad9e8ced9d3fee1115cc6c7a4cdb55df3cccb14e8f020004c5f9503c816ef46","observation_id":"d5bc1f3c-694a-492c-84ca-1463981cd374","resolution":{"observed_at":"2026-07-31T10:28:23.687225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2015-462","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xin Wang, Junichi Yamagishi, Massimiliano Todisco, Hector Delgado, Andreas Nautsch, Nicholas Evans, Md Sahidullah, Ville Vestman, Tomi Kinnunen, Kong Aik Lee, et al","venue":null,"work_id":"7729240d-1c7b-4466-af30-dd10247dc683","year":2015},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.313618Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:100f910598de2200b2269b371ff1fd693d5b8d104231839553a29d06d17939e7","observation_id":"451308d7-d185-4135-b813-98bc3758b2d8","resolution":{"observed_at":"2026-07-31T10:30:53.086958Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-08T15:38:06.345634+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T15:38:06.345634+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-07-31T10:28:23.379685Z","title":"Musan: A music, speech, and noise corpus.arXiv preprint arXiv:1510.08484,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.379685Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:13df60fed0c88c564f67c18ef31b6fb7fac57c29d3ad4fe49173947a87d681bd","observation_id":"e6d0476a-cba0-459e-a90b-cda0262fe0cc","resolution":{"observed_at":"2026-07-31T10:28:23.379685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-07-31T10:28:22.922154Z","title":"Seamless: Multilingual expressive and streaming speech translation.arXiv preprint arXiv:2312.05187,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:22.922154Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:4e34848ea4cd1d23cf65610554e0cbdadae4af0b5ebc24c8a58dd49c4444a810","observation_id":"5a0d7f71-e7bf-4804-8b48-f7515130997f","resolution":{"observed_at":"2026-07-31T10:28:22.922154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.347004Z","title":"Nicolas M Müller, Piotr Kawa, Wei Herng Choong, Edresson Casanova, Eren Gölge, Thorsten Müller, Piotr Syga, Philip Sperl, and Konstantin Böttinger","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.347004Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:28ce260ddd7f70b3d76d2f84aabeb36561dd7e5e88255d242a543933455b74aa","observation_id":"ded5af8c-1732-4ca8-8cb0-66d77a949d2f","resolution":{"observed_at":"2026-07-31T10:28:21.347004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.646660Z","title":"Add 2022: the first audio deep synthesis detection challenge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.646660Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:8258aff5d2b9c22d197ba8484aad9a856e2c03e0ba8fdd81e0f16aa584df2712","observation_id":"ce701d1d-71e4-4d8f-b9b1-07f63e086622","resolution":{"observed_at":"2026-07-31T10:28:21.646660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-07-31T10:28:21.703461Z","title":"Add 2023: the second audio deepfake detection challenge.arXiv preprint arXiv:2305.13774,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.703461Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:7e49f20e30def87ded2a9429276688318e3a1779621311294b5aff56d3f4cc24","observation_id":"d3440183-9ab5-4ed7-b769-426786d55791","resolution":{"observed_at":"2026-07-31T10:28:21.703461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-07-31T10:28:21.405092Z","title":"Wavefake: A data set to facilitate audio deepfake detection.arXiv preprint arXiv:2111.02813,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.405092Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:5b68f748ce90c0fa4c31d35da034db19640f15fb591c03f5b7becfa9644c83f6","observation_id":"8fb26762-abed-4bbb-bac9-e041a32783e0","resolution":{"observed_at":"2026-07-31T10:28:21.405092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-31T10:28:21.169578Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.169578Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:cbca7d809cc245b3fa63191afc1957ea19c3454ae880983567e7da2717818944","observation_id":"a78a6a21-751e-4731-9c43-3e2455d87a4d","resolution":{"observed_at":"2026-07-31T10:28:21.169578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.236552Z","title":"Asvspoof 2015: the first automatic speaker verification spoofing and countermeasures challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.236552Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:4973b222be56f9cca3e8e3613c731a94bf5abf92a08593e6f406804bf887d666","observation_id":"90b35423-3b9f-490f-b76b-fb8665440fa8","resolution":{"observed_at":"2026-07-31T10:28:21.236552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T10:28:21.538373Z","title":"Asvspoof 2021: accelerating progress in spoofed and deepfake speech detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:21.538373Z"},"links":{"citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:f88aaf9bd6a0567c6f79a682bdcb3c31edbc1a7b2013e7213d6f33653fe4beab","observation_id":"87fd1936-1f7a-4549-8ffd-58a26f68ae90","resolution":{"observed_at":"2026-07-31T10:28:21.538373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.28351."}