{"as_of":"2026-08-04T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a51356a4a7e67a5952c842cb331edefbfe93eaf13659bc2df44a3a9235ef6bd","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T13:01:32.716126Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T05:19:26.613301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T07:47:45.160739Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"cited_work":{"arxiv_id":"2605.03420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.03420","snapshot_observed_at":"2026-07-03T07:47:45.160739Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","venue":"cs.SD","work_id":"089df46f-5779-4072-b479-5414e1b24587","year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-03T09:56:40.761369Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:44:37.193518Z"},"links":{"cited_paper":"/paper/2605.03420","citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:d3d83cda6fe1bac12f5f3e3968a3e48c299821dab818d6fcad5af6cce383fc2a","observation_id":"fab6b24a-b7fc-4ed9-aea0-e699b9a0a007","resolution":{"observed_at":"2026-07-03T07:47:45.162298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"cited_work":{"arxiv_id":"2605.03420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.03420","snapshot_observed_at":"2026-07-03T07:47:45.160739Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","venue":"cs.SD","work_id":"089df46f-5779-4072-b479-5414e1b24587","year":2026},"citing_paper":{"arxiv_id":"2606.10791","last_updated":"2026-06-26T07:49:38Z","snapshot_observed_at":"2026-08-03T09:56:40.761369Z","submitted_at":"2026-06-09T12:42:14Z","title":"Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T05:19:26.613301Z"},"links":{"cited_paper":"/paper/2605.03420","citing_paper":"/paper/2606.10791"},"observation_digest":"sha256:27b91db48829a6a53cbfdaade76a8b295807b600f53588031172c40511a4265f","observation_id":"45700f7c-301d-4e92-8be6-0916ff1e4497","resolution":{"observed_at":"2026-06-29T17:13:45.451160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.03420/citation-record","integrity":"/paper/2605.03420/integrity","json":"/paper/2605.03420/citation-record.json","paper":"/paper/2605.03420"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions","venue":null,"work_id":"0b6cfa9e-b3ce-4a18-a5a5-ee8e3e4f2192","year":2018},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:d5b798e72826816c565b9187318e2b9ae5c68df34a9843658323988bf367a539","observation_id":"5ea2c818-999d-45e3-bbbb-2fd72c4b1daa","resolution":{"observed_at":"2026-05-27T11:39:04.548743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"af4886cd-62a5-473f-b844-43c07c3c0ad2","year":2021},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:cf1b0c231cbbbffea30685fb4a7b52f8f5a198e72264fceb3487c42ca14ff139","observation_id":"b68674b3-debb-4467-b1c0-36600ad014e6","resolution":{"observed_at":"2026-05-27T11:39:04.560451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech lan- guage models","venue":null,"work_id":"3c114e11-55ea-4760-9a11-f69cb0098996","year":2023},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:af1cf60778f59def29f580c504a36dd770ef5d7b2b71838c169b196a15120f9b","observation_id":"5d9c8094-eefb-47c5-9e80-01198b8bb346","resolution":{"observed_at":"2026-05-27T11:39:04.585169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yourtts: Towards zero- shot multi-speaker tts and zero-shot voice conversion for everyone","venue":null,"work_id":"15edc160-02f8-4f29-952b-6017424fcb97","year":2022},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:5c4baad165085d3b5eba759edd0aaf946e9f65162c3460128c02661477c50eec","observation_id":"59bec08d-c133-43f9-9735-7d7a5f3d37de","resolution":{"observed_at":"2026-05-27T11:39:04.563914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Starganv2-vc: A diverse, unsupervised, non-parallel framework for natural-sounding voice conversion","venue":null,"work_id":"4ee46ecf-0b4e-4160-ab8c-0ecf7cee9c22","year":2021},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:96c0827da8751a4ac616968e15090ba2d3dc0ef820c48c3ccd21784cfc45dbb8","observation_id":"e53a4fcf-fe72-407d-9569-09b1965794b5","resolution":{"observed_at":"2026-05-27T11:39:04.550229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2019: Future horizons in spoofed and fake audio detection","venue":null,"work_id":"3c9232b2-fcbc-415e-a62d-71c3ded1b6ef","year":2019},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:6e40f9a562919a49d653fd1b83f67ce4af3af86396fa613c88a64e9af1645a2d","observation_id":"43518327-1a30-4045-b1b6-0c45ff6a2772","resolution":{"observed_at":"2026-05-27T11:39:04.524557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoofceleb: Speech deepfake detection and sasv in the wild","venue":null,"work_id":"cd3a621a-cd04-42b4-9d13-b66d6777610c","year":2025},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:bd17712e483030a05165f13eecf21cd397af66bf298689dc9ef13e42919c5729","observation_id":"fbf3f83c-8f46-4300-8606-f763c9b2afd6","resolution":{"observed_at":"2026-05-27T11:39:04.532381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Partial fake speech attacks in the real world using deepfake audio","venue":null,"work_id":"1b105e07-a584-405f-9e6e-06f222f6dc8d","year":2025},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:ccb9db9672ad6f63c0f391d2bf9e9b586856728e12ee1bf231cf2e018c163f54","observation_id":"7a6a7310-2111-4790-ac26-ca398293bd97","resolution":{"observed_at":"2026-05-27T11:39:04.502817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00535","last_updated":"2021-09-01T15:32:28Z","snapshot_observed_at":"2026-07-06T11:43:28.084184Z","submitted_at":"2021-09-01T15:32:28Z","title":"ASVspoof 2021: Automatic Speaker Verification Spoofing and Countermeasures Challenge Evaluation Plan","version":1},"cited_work":{"arxiv_id":"2109.00535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00535","snapshot_observed_at":"2026-07-04T07:49:38.582731Z","title":"Asvspoof2021:Automaticspeakerverificationspoofingandcountermeasureschallengeevaluationplan","venue":null,"work_id":"fd74944f-9e0c-4186-a5da-bec69a728d0b","year":2021},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"cited_paper":"/paper/2109.00535","citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:9b7a7284df8a63b37b9114ccad3ad5e2af8d2d4dc653d90062d583df1bdcf6ec","observation_id":"cfccc371-3d31-4eb8-9b73-315ce904f298","resolution":{"observed_at":"2026-05-12T10:51:31.921992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Add 2022: the first audio deep synthesis detection challenge","venue":null,"work_id":"f24a9deb-30c7-4e92-b658-5e1e24905deb","year":2022},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:3ae3ea20c482649e8385c90eb3356d67dd149351d911e99d97d01cd4a5a40f10","observation_id":"aa3c082f-a97b-402a-a1aa-feb01b7ab5d7","resolution":{"observed_at":"2026-05-27T11:39:04.519930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wavefake: A data set to facilitate audio deepfake detection","venue":null,"work_id":"7a8fbc0c-d659-47b5-b7e8-3f52ddc75cd4","year":2021},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:8202428c87102feae5d55e796e82a97eda2e8162865b9fa9d7774d133db0c08f","observation_id":"c4bc1d59-da12-4826-b9a8-9be29335759b","resolution":{"observed_at":"2026-05-27T11:39:04.560130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfake audio detection via mfcc features using machine learning","venue":null,"work_id":"ed7758ab-9433-4253-87fc-a56642d074b0","year":2022},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:c630ad0347ed67bcee31635e3037689ac9779558321646d6b3c05304bfc708a6","observation_id":"ac3effc8-f2d1-44b5-9c3b-3daf941455db","resolution":{"observed_at":"2026-05-27T11:39:04.552937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid transformer architectures with diverse audio features for deepfake speech classification","venue":null,"work_id":"dac476e7-1a01-40ab-8bb5-962619c05188","year":2024},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:64db1e0278c21922caf33aa69b79471f3fe96aed414ce42440e6846a8c615777","observation_id":"20eae8f4-0122-4d03-90a2-c754f4111757","resolution":{"observed_at":"2026-05-27T11:39:04.538725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2019: Spoofing countermeasures for the detection of synthesized, converted and replayed speech","venue":null,"work_id":"3ec50fc1-9d15-484c-987d-63d259725d96","year":2019},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:4043bcab93f09eb816a3bec92af5a2346c94b4e2a87b2871482a40e7547773d0","observation_id":"f3da48f1-dc6c-4a8d-9255-37bc8cafc205","resolution":{"observed_at":"2026-05-27T11:39:04.576381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep attention mechanism residual network for audio deepfake detection using multi scale cepstral coeffi- cient features","venue":null,"work_id":"5c18960c-10e1-4d8d-8784-5bf23c8b46ba","year":2026},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:28e58fd11769f1af2ee07337ec46a6b73f7f36a3cba618befd9cdf347a05dba6","observation_id":"f7fcc6bf-2a14-43a0-84e2-25ba48ec8ce0","resolution":{"observed_at":"2026-05-27T11:39:04.580052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture of experts fusion for fake audio detection using frozen wav2vec 2.0","venue":null,"work_id":"29842f9d-2fdc-4ced-8b19-e465cbf72c08","year":2025},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:c2f8939b7408e01eee73c2d1eb62ac47114966186a8aee45368f37696f95d7fa","observation_id":"98fd61d8-92af-46d4-91f1-9fc5e835cbbf","resolution":{"observed_at":"2026-05-27T11:39:04.588793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oice deepfake detection using the self-supervised pre-training model hubert","venue":null,"work_id":"195d016f-6479-429d-bd0a-c69661df78db","year":2023},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:25bb46efa0d8c11c9035e57df7ac20a0e0cb2c8a835bd9ba5d2a7ff804fc7204","observation_id":"df7abe2e-8a29-48af-a38c-d6080be278d5","resolution":{"observed_at":"2026-05-27T11:39:04.556524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wavlm model ensemble for audio deepfake detection","venue":null,"work_id":"9ba10e64-cfe5-4dd3-ac86-c4dd803e81ff","year":2024},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:ab6b3406512c3396d4b00ffeecffbb5d7bc14b25f8c2aa56f7eca760a497c3d7","observation_id":"18bd9f23-c802-4aec-a334-7cebf72ecca6","resolution":{"observed_at":"2026-05-27T11:39:04.568034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free deepfake voice recognition by leveraging large-scale pre-trained models","venue":null,"work_id":"1ba312d9-f3d0-43e4-bcff-e8edebb38dcd","year":2024},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:af150b7906189581d5f78b784b843b8ffd2be90d0b6c903bc5f1e1d8b00547aa","observation_id":"a577f3c7-0179-4cea-85be-1b70d59c5a95","resolution":{"observed_at":"2026-05-27T11:39:04.546731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale","venue":null,"work_id":"ee155985-d225-4d95-a83f-1af4a4ec3032","year":2022},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:2cd86124d8485ff8475bb31569163d24800ede25b4b98649fd26258266158ecf","observation_id":"cbc48424-f100-4106-838d-671dc68cdd60","resolution":{"observed_at":"2026-05-27T11:39:04.540548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beats: Audio pre-training with acoustic tokenizers","venue":null,"work_id":"f9eef3e9-9179-4c61-91ce-0c28598b812d","year":2023},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:223745d4b7fbd9bd7908d35a2b1bfff9ecb54d67ea709357ae40cf1902bf2592","observation_id":"5e6ea013-9a72-4a62-b86a-71d8d20cbf61","resolution":{"observed_at":"2026-05-27T11:39:04.553505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aasist: Audio anti-spoofing using integrated spectro-temporal graph attention networks","venue":null,"work_id":"09e4e6db-5c65-42f5-b520-5f7cd9a33da9","year":2022},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:dfcd0f4ce047f4432d0500c5a59bcdaace070fb58bd20d5e9d7bcda691a0b05e","observation_id":"a7bb388f-d933-42ce-a3d1-027858ab98b7","resolution":{"observed_at":"2026-05-27T11:39:04.572483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Esdd2: Environment-aware speech and sound deepfake detection challenge evaluation plan","venue":null,"work_id":"cc5b2783-3bac-4897-b1cc-74cb8d37ec22","year":2026},"citing_paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T13:01:32.716126Z"},"links":{"citing_paper":"/paper/2605.03420"},"observation_digest":"sha256:5e6a9a333d9308471898185f8c2992ac7b539e04eee12787f34fff5925af7ffe","observation_id":"7b9ac874-da98-4c95-9207-5540316c43d5","resolution":{"observed_at":"2026-05-27T11:39:04.523467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03420","last_updated":"2026-05-05T06:51:41Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-02T14:37:25.615088Z","submitted_at":"2026-05-05T06:51:41Z","title":"Deepfake Audio Detection Using Self-supervised Fusion Representations"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 2 inbound Pith citation observations for arXiv:2605.03420."}