{"as_of":"2026-08-14T12:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48131c16e075d29a5262a5b3a0e0bd42c3d0c123ee349961ca55337527b19b14","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:43:55.926243Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.08104/citation-record","integrity":"/paper/2604.08104/integrity","json":"/paper/2604.08104/citation-record.json","paper":"/paper/2604.08104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of a udio classiﬁcation using deep learning","venue":null,"work_id":"c7a0e2db-4841-450f-9f2f-5c1122b21ac9","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:6be288a1620528dd341332a6870ec6e4e134ede3d712a0cfcad1133e8fe90c29","observation_id":"f75f32f4-986e-46f5-a75a-68522d9cc290","resolution":{"observed_at":"2026-05-17T09:19:23.261161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural tts synthesis by conditioning wavenet 24 on mel spectrogram predictions","venue":null,"work_id":"2a3c0971-bbb9-47e0-99b7-7e9da8796bf2","year":2018},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:f6d4f6199bfe23435b48eb3d8bf30b18a43b49a145d9e44b8cc089a81b925903","observation_id":"c4d5c5ec-2c95-4109-ac96-d249ec751ffb","resolution":{"observed_at":"2026-05-17T09:19:23.257999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional variational aut oencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"b4a80acf-0569-44d0-9eae-aff33cf75b8e","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:575234cfb1189072030f16773d129515751810730e7080527a73cfb94556a5e1","observation_id":"2595a6ef-d970-439b-b549-380748583988","resolution":{"observed_at":"2026-05-17T09:19:23.246110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Starganv2-vc: A dive rse, unsupervised, non-parallel framework for natural-sounding voice conver sion","venue":null,"work_id":"0e9419d7-af94-40d6-93f8-db72e4c12602","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:e4e661d5b40305183e28770e871dd0ffa952b4433557243c879a2576d30fef23","observation_id":"7d289da8-1690-424a-b500-a272be6f800b","resolution":{"observed_at":"2026-05-17T09:19:23.250477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2019 : Future horizons in spoofed and fake audio detection","venue":null,"work_id":"6acb7c86-7fc3-4ef9-8f82-aa7485fafd67","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:98ac470ddea9ed2c6078d17b4892353c3e6ac0b2845ce490ead02b3a3b63bfbb","observation_id":"74cd1d5e-4f67-4eca-b1cc-f0f337f15a19","resolution":{"observed_at":"2026-05-17T09:19:23.270525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoofceleb: Speech deepfake detection and sasv in the wild","venue":null,"work_id":"6381fa89-3914-4f5c-bc25-6e0596226ca3","year":2025},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:1452459259129abc553a667eae5ea1b76c6bb42ec2e393262c507a7cebd972c3","observation_id":"8c172fa5-56da-469a-bb9e-c60da877fc0a","resolution":{"observed_at":"2026-05-17T09:19:23.264237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfake speech detection using perceptual patho- logical features related to timbral attributes and deep lea rning","venue":null,"work_id":"8f518bab-be12-4ff3-af50-e15833d251e5","year":2077},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:5da52a097f244b048bd559569e3c3c401b84ede46e844819b0022ddff309dc39","observation_id":"51b42f80-3f45-480f-93b5-40f4c05f3deb","resolution":{"observed_at":"2026-05-17T09:19:23.267436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An evaluat ion of convolutional neural networks for music classiﬁcation using spectrogram s","venue":null,"work_id":"b00ed3fe-1ef0-4c83-9433-1087668afa68","year":2017},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:0e7ce110fd0f9033b10a429bc38d2de82f20a4ea4f3314e82fd86736260fddfc","observation_id":"e4419ebb-88e4-40e5-9aad-c9cfe515a4d5","resolution":{"observed_at":"2026-05-17T09:19:23.254454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classiﬁcation of harmful noise signals for hearing aid applications using spectrogram images and conv olutional neural net- works","venue":null,"work_id":"a677d09b-86e8-44de-9eb8-3bf4abf7839e","year":2020},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:364d3027c0109bd3301416775023bdf88db2984de71249d64dcdc8579abbe0e3","observation_id":"360cbf62-d813-4d62-99dd-c1995c1120b5","resolution":{"observed_at":"2026-05-17T09:19:23.236332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision transfo rmer based audio clas- siﬁcation using patch-level feature fusion","venue":null,"work_id":"cefaac0b-13c1-49a9-bc1b-8d8bf819857e","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:da1d32f93318ae8b1475da5f3f621c1ebb464154af505adf670172e641a35957","observation_id":"e2849bae-c709-4d38-a401-f95360224d8f","resolution":{"observed_at":"2026-05-17T09:19:23.239681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiscale audio spectrogram trans former for e ﬃcient audio classiﬁcation","venue":null,"work_id":"8a5ec007-474b-4b69-b82a-5b458dbced0a","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:11a6b59fee4bb71cece130dc86c68d4bd825febed77b4e1d2bde656a42529395","observation_id":"be98a4ec-87ac-4de4-b685-9cdf0c100916","resolution":{"observed_at":"2026-05-17T09:19:23.242792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking environmental sound classiﬁcation using convolutional neural networks: optim ized parameter tuning of single feature extraction","venue":null,"work_id":"6c55cb13-4434-4adb-bee8-3ddbfbea2b4d","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:e718210971f6b75655a44cceab3c5f39ae58fe1a05f3fa230c8b9666bb66c755","observation_id":"4cd397bc-7920-4ea3-bc3b-168f7c887e1c","resolution":{"observed_at":"2026-05-17T09:19:23.188049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectrogram trans formers for audio classiﬁcation","venue":null,"work_id":"9192bd59-8c67-4eba-85d9-483a71d1722d","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:cd90f2c34f8a46e9dd43384942adb99ada27efb6fb9d3066c402901ff330264c","observation_id":"56e54acf-9e9d-47bf-b39f-b8b779754634","resolution":{"observed_at":"2026-05-17T09:19:23.190915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trans- formers for urban sound classiﬁcation—a comprehensive per formance evalua- tion","venue":null,"work_id":"7b142373-a611-46ee-baec-ef2d74f53d41","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:5a70be4fab09ec9ed15aa74e65890902f7061cc8a61fc15aee5bb714d505f83d","observation_id":"64b7caad-6903-4611-813c-687989dbeeda","resolution":{"observed_at":"2026-05-17T09:19:23.220859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Environmental sound classiﬁcation with tiny transformers in noisy edge en vironments","venue":null,"work_id":"dcd94fd1-b1f0-4059-bf04-c73cb4f88eec","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:cba929478ac61e4546232211a699c4d829c274228bd88a8589f5e30c4a59da7e","observation_id":"fe4f445c-5cb6-4ebc-b95a-8c16373d08cb","resolution":{"observed_at":"2026-05-17T09:19:23.227443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ssast: Se lf-supervised audio spectrogram transformer","venue":null,"work_id":"d5d5af5c-f6cf-4552-8aad-ec4c0de40852","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:d5744b7667d586edc70b49e8bd5b26498dbffb6a8aa992628d0db69115189eee","observation_id":"86fcc3a4-213a-4e7d-8f9f-31ddee1bec5e","resolution":{"observed_at":"2026-05-17T09:19:23.184944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E ﬃcient training of audio transformers with patchout","venue":null,"work_id":"c128f975-3a10-41c9-88b5-ee67e7d702a6","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:dac396e87bc49c11deeddfb5ce5feec2f3670f3ab2e8181747f3ef45ba239282","observation_id":"399d2582-f05a-468b-9bcf-9d06cbd671f1","resolution":{"observed_at":"2026-05-17T09:19:23.181977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S3t: Self- supervised pre- training with swin transformer for music classiﬁcation","venue":null,"work_id":"0b837dfe-96d5-4a89-a50c-2d2c00a3aef5","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:e1bda153ec4f5f7ccd106f86ce6381288401fd09ca74669969a37c995fc888b8","observation_id":"ebd61a4c-cf52-4831-ab62-b212a598d1d6","resolution":{"observed_at":"2026-05-17T09:19:23.230690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asit: Local-global audio spectrogram vision transformer for eve nt classiﬁcation","venue":null,"work_id":"ca7b9bec-8af6-46ea-be69-05c8211d5947","year":2024},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:35cf9f17864dcf5726b72e1261a0331b3fbb52f5a0a12cf978a4cb6be6f9fe4a","observation_id":"9d21389d-c3fe-42e5-b462-e10d6f9245bf","resolution":{"observed_at":"2026-05-17T09:19:23.193755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cat: Causal audio trans former for audio clas- siﬁcation","venue":null,"work_id":"d7547a0e-d1f2-454a-b443-780b477c79ae","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:60edb58eac88ddd4fe075844e511e1499ee0c3153554cff8622f22e9b755221b","observation_id":"d5820aee-7a6f-4a73-88ab-f644a67b7260","resolution":{"observed_at":"2026-05-17T09:19:23.214329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound c lassiﬁcation and detec- tion","venue":null,"work_id":"1b4527d6-7d21-49cf-9ec7-182b5caf6c1f","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:6a5c6ae9d48e192eeb1885a7bb946be21f500c3962cf2f9f97aa808c3f5a24b2","observation_id":"575c7efd-2293-47c5-a1c5-b3b336e191b7","resolution":{"observed_at":"2026-05-17T09:19:23.217468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V att: Transformers for multimodal self-supervised learn ing from raw video, audio and text","venue":null,"work_id":"15a3b873-13cf-4720-8701-a40c06d1cd3c","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:3df6412192ded83777fb9f480944e99141354e281ad828d6dce1706446281b1d","observation_id":"dec173c0-550c-40c3-b39e-1f7652f650e2","resolution":{"observed_at":"2026-05-17T09:19:23.224304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2 019: Spoof- ing countermeasures for the detection of synthesized, conv erted and replayed speech","venue":null,"work_id":"97efd8fd-5a6d-445d-ba48-225ce0c59c93","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:388ebe9d3392a055dfc9675e7c3a608f03a871890c563ff27afad9528b396583","observation_id":"b9ec34fb-b03c-4643-b843-b008093c0333","resolution":{"observed_at":"2026-05-17T09:19:23.202764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bpcnn: Bi-point input for convolu tional neural networks in speaker spooﬁng detection","venue":null,"work_id":"a13c4321-e05d-469c-a181-7dc0adfe8798","year":2022},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:97a4a2bdd46e094140a8572fa368938c0d700ac96a3f14481ddb04cd29a5c2b1","observation_id":"c0963a43-fbd3-4cd9-a377-f114f37dd698","resolution":{"observed_at":"2026-05-17T09:19:23.196850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"U nmasking the truth: A deep learning approach to detecting deepfake audio through mfcc features","venue":null,"work_id":"df0799f6-e964-4dec-bdae-45b8b46e519e","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:802227f5acbf176f94df1f75f4b9c06fe266d5c33554b0e9535b305c268f501a","observation_id":"46bb6e3e-6a70-423a-9c6f-f3df3f0bc56b","resolution":{"observed_at":"2026-05-17T09:19:23.205500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.03464","last_updated":"2020-08-08T07:14:40Z","snapshot_observed_at":"2026-07-06T09:45:32.493935Z","submitted_at":"2020-08-08T07:14:40Z","title":"Audio Spoofing Verification using Deep Convolutional Neural Networks by Transfer Learning","version":1},"cited_work":{"arxiv_id":"2008.03464","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.03464","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio spooﬁng veriﬁcation 27 using deep convolutional neural networks by transfer learn ing","venue":null,"work_id":"16382c7d-27c5-4dcd-8ba8-614f135a591c","year":2008},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"cited_paper":"/paper/2008.03464","citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:9343226449b0d2cf9bcb38fbbf73ba71e4bfab2953ed5d6bd332a52ba664ed3b","observation_id":"f9c2da99-869f-4ac0-a5a4-2e201abf4e45","resolution":{"observed_at":"2026-05-11T06:15:58.024088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ensemble models for spooﬁng detection in automatic speake r veriﬁcation","venue":null,"work_id":"0b8a20c4-33e7-416c-a9f6-8be2813dc922","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:f0c0515c21b984606eef604252aabcc34f117d8cf9a975f176373e29b92d3e94","observation_id":"f6594163-ac07-4ff2-a169-d41310c8d3bb","resolution":{"observed_at":"2026-05-17T09:19:23.208453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ana lysis of spectro- temporal modulation representation for deep-fake speech detection","venue":null,"work_id":"0b951293-9ee7-48ac-a800-8893904ccd5e","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:c0953be7c14fdf15a60759583a3303f66a75e3c28a4eef90de1862dc2c821041","observation_id":"549288ce-270b-4651-872a-7dd1aab9c4b4","resolution":{"observed_at":"2026-05-17T09:19:23.211256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfake au dio detection with vision transformer based method","venue":null,"work_id":"07913867-670a-484f-9ab4-1fdab36a4bd6","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:91d43d7a86557bcdbb7a7fa894f06a4cd537329d74179f88eb77c8ae9eb0fef8","observation_id":"32a8093a-daba-4892-b473-b23129967d62","resolution":{"observed_at":"2026-05-17T09:19:23.199722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesized speech dete ction using convolutional transformer-based spectrogram analysis","venue":null,"work_id":"d924ce80-07dc-4131-a195-8f33512e8cd3","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:a77f5e86c3f1a38e1076e3368c4bf15818654ef3d5f5077393d21a40ade86061","observation_id":"7217cb86-840d-4cc0-b33c-28e78c86d454","resolution":{"observed_at":"2026-05-17T09:19:23.159551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assert: A nti-spooﬁng with squeeze-excitation and residual networks","venue":null,"work_id":"528f9d6a-b3dd-4a16-bc09-a3eb33953c80","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:88e7b598a0b1b8cdce5b28c237a66fc5bbbae0fe4a32e2d116d7777eae6c95a1","observation_id":"16d5c677-3c52-4a39-88b8-d69fb7a021fb","resolution":{"observed_at":"2026-05-17T09:19:23.179071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5cf08a29-483e-4592-9f3e-d254abdf6d8f","year":2020},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:2f1c629148a2cdd2830b483021b4caa48188b812fdc470ceadd8940cdf711d69","observation_id":"f3cb2230-b942-4b70-b593-a6c0c24558e0","resolution":{"observed_at":"2026-05-17T09:19:23.156439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long range acoustic and dee p features perspective on asvspoof 2019","venue":null,"work_id":"870af71e-908c-408f-abd4-9cbcaa9c20fe","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:959820db5b54faafd35c39ef68ae38bcaeeb7f36b2566df3d4d7e5d1d2141813","observation_id":"b019258c-2922-43ad-92fc-d49efbb4fc43","resolution":{"observed_at":"2026-05-17T09:19:23.175164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesized speech detection based on spectrogram and convolutional neural networks","venue":null,"work_id":"598f5651-0204-4526-a7d0-838d2f9e172e","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:96ca14fa815d248fcf395e2adaa8ac6ae5b5c71e3be1012ef9d355d4729e5ac6","observation_id":"ba1b838c-6e9f-4d0f-9257-ee443e0bee38","resolution":{"observed_at":"2026-05-17T09:19:23.139368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residu al neural networks for audio spooﬁng detection","venue":null,"work_id":"ca18868c-0263-477b-8581-2b5cd540f6d7","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:f823d4a799c36f4a18faf1d6f7972e58e3c7957ad2d1dfe5600a8c5e5705f8c4","observation_id":"1a410eec-cf05-4200-84e3-9531884ff0ba","resolution":{"observed_at":"2026-05-17T09:19:23.162618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Siamese convolutiona l neural network us- ing gaussian probability feature for spooﬁng speech detect ion","venue":null,"work_id":"8e30b667-0752-403b-900d-45159ccb122c","year":2020},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:b6a5ee2a0f16e83fe013d5377076b884e3dfe9d4ae19d89f22212faea1f609a0","observation_id":"4f15ffe8-6ce2-465e-ac21-b2bbd03e3293","resolution":{"observed_at":"2026-05-17T09:19:23.148483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frequency domain-based detection of generated audio","venue":null,"work_id":"3c3c6fd0-bd16-40d2-8db0-e53c117dd457","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:9a0f057628481e83099efd4768a3d9bd0839dcd153000ff99429b8ac8c9164f8","observation_id":"fac5678e-49d7-49e3-b2dd-dad594153247","resolution":{"observed_at":"2026-05-17T09:19:23.145333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantum vision theory in deep learning for ob ject recognition","venue":null,"work_id":"49fa3dc9-7825-4d95-b9c6-740de26d51a5","year":2025},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:e9b44fcc26fa7a5031e60166bd3659f0817068c1f660c63c87e71190726c0fca","observation_id":"ae36c714-c85b-440c-9e99-c810ecc7a0f8","resolution":{"observed_at":"2026-05-17T09:19:23.151486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"0affc38e-bbbe-4dd4-9db3-c00251f0c5b3","year":2021},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:1f00768f211994bc76ddea533434dc808f9c3b307d1712c66c9b0c1ce8d44480","observation_id":"33d76ef3-baf1-43f5-9d1f-9741f72ae3c2","resolution":{"observed_at":"2026-05-17T09:19:23.142248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asvspoof 2019: A large-scale public database of synthesized, converted an d replayed speech","venue":null,"work_id":"873a6ca2-26e6-4265-a747-3a2a652724fd","year":2019},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:11e118a0b1ca83d35cee2f5456ddfb39f2c06cb6766ce5a8b713d78d301a9f60","observation_id":"f7585c7e-5385-4b2f-9bd9-56bfc7d7f2fc","resolution":{"observed_at":"2026-05-17T09:19:23.165890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio transformer for synthetic speech detection via benford’s law distribution analysis","venue":null,"work_id":"91801253-bb38-498d-b49b-2093cf4a6be1","year":2024},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:3c971c2a44c276cbb92e6e5e839c3ce1a08098152f4bb5752e5b08d3787bcd34","observation_id":"0983e762-a4da-403f-9226-489461b79124","resolution":{"observed_at":"2026-05-17T09:19:23.168992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio spe ctrogram transformer for synthetic speech detection via speech formant analysis","venue":null,"work_id":"e1978789-6323-44b7-bdb3-22968bade43b","year":2023},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:19ad508e1c0f550c1ca34b8bdd6f66ed23c020dd072482c46b1a5867da5638ae","observation_id":"54fb20a8-1e06-4541-a788-e89ea5f861b8","resolution":{"observed_at":"2026-05-17T09:19:23.136435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid transformer architectures with diverse audio features for deepfake speech classi- ﬁcation","venue":null,"work_id":"4f33324b-55f7-46b4-bce6-a666065f22ae","year":2024},"citing_paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:55.926243Z"},"links":{"citing_paper":"/paper/2604.08104"},"observation_digest":"sha256:da8dde353491b1e33f2eb80849de21ff74d570593416b2179ad479d05720d59d","observation_id":"b03e0831-c0a5-41b6-ad60-711ad72bbb67","resolution":{"observed_at":"2026-05-17T09:19:23.172069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.08104","last_updated":"2026-04-09T11:22:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:22:40Z","title":"Quantum Vision Theory Applied to Audio Classification for Deepfake Speech Detection"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2604.08104."}