{"as_of":"2026-08-21T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9383384d7294e6e930bc1db570ea87d180ccd6a7e33699ad5ff48088ccd244df","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:12:07.957087Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:12:07.758738Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T18:58:08.973922Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08476","snapshot_observed_at":"2026-08-15T16:12:07.758738Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.758738Z"},"links":{"cited_paper":"/paper/2509.08476","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:b74a6b58139f34e67e5b8fb3fc77ce180993a143d98dc211a413afba1eb6f89e","observation_id":"bb23e694-d3e6-41dd-a485-8cd724a5898f","resolution":{"observed_at":"2026-08-15T16:12:07.758738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08476","snapshot_observed_at":"2026-08-03T08:05:55.544548Z","title":"Wang, S., Li, Y ., and Xing, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18537","last_updated":"2026-07-21T01:30:59Z","snapshot_observed_at":"2026-08-18T02:34:15.083411Z","submitted_at":"2026-01-26T14:42:31Z","title":"SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T08:05:55.544548Z"},"links":{"cited_paper":"/paper/2509.08476","citing_paper":"/paper/2601.18537"},"observation_digest":"sha256:033b04edf0f4aa1d7a3f3ebf7768a7e3159c2a93a303854a8eed4ba0d9799489","observation_id":"d41f6769-6669-452f-8b7f-8a5f7c366963","resolution":{"observed_at":"2026-08-03T08:05:55.544548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"cited_work":{"arxiv_id":"2509.08476","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08476","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio deepfake verification","venue":null,"work_id":"93bef1d5-38b1-4286-91ee-7ad7f6106b36","year":2025},"citing_paper":{"arxiv_id":"2604.02937","last_updated":"2026-04-03T10:08:53Z","snapshot_observed_at":"2026-08-02T18:04:55.530371Z","submitted_at":"2026-04-03T10:08:53Z","title":"If It's Good Enough for You, It's Good Enough for Me: Transferability of Audio Sufficiencies across Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T18:53:48.881039Z"},"links":{"cited_paper":"/paper/2509.08476","citing_paper":"/paper/2604.02937"},"observation_digest":"sha256:13515acf8e5546fb571a920879a6346c48e2ce07cbe5322fa1ae9e8c8031e815","observation_id":"690143fd-25c7-4914-a960-92374d3216bc","resolution":{"observed_at":"2026-05-13T18:58:08.975243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08476/citation-record","integrity":"/paper/2509.08476/integrity","json":"/paper/2509.08476/citation-record.json","paper":"/paper/2509.08476"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08476","snapshot_observed_at":"2026-08-15T16:12:07.758738Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.758738Z"},"links":{"cited_paper":"/paper/2509.08476","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:b74a6b58139f34e67e5b8fb3fc77ce180993a143d98dc211a413afba1eb6f89e","observation_id":"bb23e694-d3e6-41dd-a485-8cd724a5898f","resolution":{"observed_at":"2026-08-15T16:12:07.758738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.519349Z","title":"semantic","venue":null,"work_id":"69434a3b-33f8-48ad-9fed-aeadced5949a","year":null},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.764286Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:abff658d24c25ca0c8dbfa35ea7355979c50e9c097596eb6f565a0c8656bcc45","observation_id":"9e7ba250-8385-4462-92fb-5a88d7c5abd8","resolution":{"observed_at":"2026-08-15T16:12:08.523918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.507373Z","title":"different","venue":null,"work_id":"f4bb1de2-5d33-445b-8c4e-e3583b360f1e","year":null},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.769199Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:4abc688d25ba55172e952fba48980c6b8008f229cda54821022aaa1d1533f669","observation_id":"25c5fa05-3c4d-408e-a4d9-d0c6845de374","resolution":{"observed_at":"2026-08-15T16:12:08.511265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.495556Z","title":"Acoustic model","venue":null,"work_id":"32d54c21-6d01-486a-93f2-338190641512","year":null},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.774035Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:095bd98eafe08cdaae9c1e9ac7ebba9fa94bd8b93b530e1bf2de223f4f855501","observation_id":"c2fd140a-8606-41c8-82e9-9c5abd84c408","resolution":{"observed_at":"2026-08-15T16:12:08.499663Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.482319Z","title":null,"venue":null,"work_id":"42ec7ee3-42bc-47a6-bc8e-c90f4da8720b","year":null},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.779815Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:0a60bb5f340367074ca102e977e6b015fa88e297de41c15b052662d6f190af3c","observation_id":"b8ae7d80-fbbb-49d4-88dd-d29e54715a40","resolution":{"observed_at":"2026-08-15T16:12:08.486784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.465302Z","title":"The emergence of deepfake tech- nology: A review,","venue":null,"work_id":"36c96ec0-210c-4fbd-a332-1d049ec057df","year":2019},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.784205Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:c89dbe43c4c077ec834a2a77613e2fc79e8703c7c3eccd1e41fbc510d8a28db1","observation_id":"a5e6b22f-5ed7-44e8-8265-fb7df1d94ff5","resolution":{"observed_at":"2026-08-15T16:12:08.469688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.452451Z","title":"Audio anti-spoofing detection: A survey,","venue":null,"work_id":"5faacc37-1dab-4371-9d22-70b221375219","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.789313Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:505a53a4de8e55c8411ac944cae252772224302b6d01d64a984116a3bd06711e","observation_id":"94d5024a-4175-447f-bd1c-de9d3b0f5e97","resolution":{"observed_at":"2026-08-15T16:12:08.456800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14970","last_updated":"2023-08-29T01:50:01Z","snapshot_observed_at":"2026-08-20T12:29:57.127709Z","submitted_at":"2023-08-29T01:50:01Z","title":"Audio Deepfake Detection: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14970","snapshot_observed_at":"2026-08-15T16:12:07.793124Z","title":"Au- dio deepfake detection: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.793124Z"},"links":{"cited_paper":"/paper/2308.14970","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:51ac42f84f62cd965032c99276367d11217d4970b2f533a88eb91852197e2b44","observation_id":"790144dd-3e04-4029-93e0-cc8f08e65eee","resolution":{"observed_at":"2026-08-15T16:12:07.793124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.440405Z","title":"Audio deepfake attribution: An initial dataset and in- vestigation,","venue":null,"work_id":"01fc4a57-233a-494e-9430-709999e59662","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.798742Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:32ac9a074c15b809b4e746428966eafe4eb73f563a1231c4eb248c357c6bc482","observation_id":"a9ee82c4-62f2-4925-8eee-be31ff655e55","resolution":{"observed_at":"2026-08-15T16:12:08.444354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.427781Z","title":"An initial investigation for detecting vocoder finger- prints of fake audio,","venue":null,"work_id":"a095322f-9edf-4a2c-90e9-23af2bad1b43","year":2022},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.804003Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:89521cf656285045dde4b714b8ef9cb2deb8bf4a6d9048b83b81a90c4a50b054","observation_id":"8fa9b036-b8f9-46eb-bb9f-c00c5d798f8d","resolution":{"observed_at":"2026-08-15T16:12:08.432133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-08-20T03:00:07.655339Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-08-15T16:12:07.812532Z","title":"Add 2023: the sec- ond audio deepfake detection challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.812532Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:ff91602954257818c239f53c47091d8bdea52f7afd3379e0a5cb24077a31e767","observation_id":"fa56aa13-6a7f-4cf6-b68d-2428f527d01a","resolution":{"observed_at":"2026-08-15T16:12:07.812532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.412812Z","title":"Source tracing of audio deep- fake systems,","venue":null,"work_id":"ddf6032f-32f7-4d1e-8208-9a089868fdfa","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.818564Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:1370a70357ee2c2dca921512bc1001a9e854c843d5ef90682eb8b84cd57720ee","observation_id":"5638fe8b-90fc-4053-99bc-7f5bde31dae6","resolution":{"observed_at":"2026-08-15T16:12:08.417049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.400878Z","title":"Generalized source tracing: Detecting novel au- dio deepfake algorithm with real emphasis and fake dis- persion strategy,","venue":null,"work_id":"34f84fad-a16b-42c6-9c94-8100702bca3a","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.833227Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:cd3b8ad2852749d7762c54c2cd0bef2208623cfb6d12a3f242ad2105d8059a1b","observation_id":"48b1dd65-e893-46d2-8f99-d694e2b9ad6c","resolution":{"observed_at":"2026-08-15T16:12:08.405056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.388176Z","title":"Generalize audio deepfake algorithm recognition via attribution enhancement,","venue":null,"work_id":"455e66c1-dace-4e31-90b7-a3a8f8000b15","year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.838002Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:b94e7658fa9ee7140495bb58d50d06b831ac42cb26eb21f33fb0e323ee43e5b8","observation_id":"267347e2-7b3a-459b-8dcf-15cd5de2d7fd","resolution":{"observed_at":"2026-08-15T16:12:08.392283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.374908Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"f84d4ced-69aa-40e7-92bf-2640ebba1ae9","year":2020},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.842664Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:64bfe0c77c9a32c989dced56446cb438856959ae12987e34a39fb756d31cd28c","observation_id":"5a7d6ad7-56ca-4cee-b752-c5f5e6fef821","resolution":{"observed_at":"2026-08-15T16:12:08.379697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.362243Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"568ba492-18f3-48dd-807e-fee986233dad","year":2022},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.846609Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:ffede541ba1fe1c937cf48acf0b17a53327fa87b1a5fd6ca6c0219aaa97adb6b","observation_id":"cf8210cd-388b-47cc-a94a-f1981bae7036","resolution":{"observed_at":"2026-08-15T16:12:08.366481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-19T22:26:55.755677Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-15T16:12:07.850791Z","title":"Seamless: Multilingual expres- sive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.850791Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:35d5599b1842c1439b9c4cdf22ae24de62293d942696d8242bf9845c636f680f","observation_id":"06258145-fad3-4bb8-8a46-ff44d7ca5dae","resolution":{"observed_at":"2026-08-15T16:12:07.850791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.349920Z","title":"Using mlaad for source tracing of audio deepfakes,","venue":null,"work_id":"aaafa248-aca2-4a76-a4fa-859d5c39e682","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.855436Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:f4f42f628838a1ddaa1d4e328491f29105bbad3a2fb8ba02f11f9494fd2271b8","observation_id":"6cc07963-087a-45fb-9fe4-c3aa53ddbd45","resolution":{"observed_at":"2026-08-15T16:12:08.354065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.335702Z","title":"Asvspoof 2019: spoofing countermea- sures for the detection of synthesized, converted and re- played speech,","venue":null,"work_id":"b3f5729c-203a-445d-8bf9-e883479b2d57","year":2019},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.860170Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:5a15f552d66648241accf1c492c643d51632133d80e59afadd9daa16c15f7c0d","observation_id":"c02da744-250e-4cf6-b1f4-e733f34eb71e","resolution":{"observed_at":"2026-08-15T16:12:08.340734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.319884Z","title":"The codecfake dataset and countermeasures for the universally detection of deep- fake audio,","venue":null,"work_id":"54d2be9b-94b2-4e96-b4f1-cc7507ab280a","year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.864147Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:902447dd87b2eaef182da604461391d192f449abd35bb40419d25bea715cdc23","observation_id":"164d8038-d8ae-406d-babe-e55566c6c4ae","resolution":{"observed_at":"2026-08-15T16:12:08.325135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.306840Z","title":"Codecfake+: A large-scale neural audio codec-based deepfake speech dataset,","venue":null,"work_id":"d0d47218-52c9-4f3d-8c9d-bf8ce12e619b","year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.868561Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:211e4b4ce61288a8961d3216e6bdbeb75879a883b42f46ca05322011f4eaa041","observation_id":"da3e41fb-cafe-4bed-80ef-705ccd0ff242","resolution":{"observed_at":"2026-08-15T16:12:08.311349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.294229Z","title":"Dfadd: The diffusion and flow- matching based audio deepfake dataset,","venue":null,"work_id":"86b38760-1339-4c0e-8cda-e19c5f0d4783","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.872673Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:64eb59d3407fa21561447e2e526b484e8c41ad2feb50a864cfee7f83866775f5","observation_id":"d54b01b8-733d-4e9c-8a4d-3dde79c1b238","resolution":{"observed_at":"2026-08-15T16:12:08.298462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T16:12:07.877383Z","title":"Gigaspeech: An evolv- ing, multi-domain asr corpus with 10,000 hours of tran- scribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.877383Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:6c039f09ed865f3f6664c7bc18ba427ac0e6e44ed890f4b2f0c8d9028d0e1421","observation_id":"45ad6b17-a9c7-4b66-a224-3486e2a55fb8","resolution":{"observed_at":"2026-08-15T16:12:07.877383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.280964Z","title":"Ai-synthesized voice detection using neural vocoder ar- tifacts,","venue":null,"work_id":"d8acbc46-7054-47e8-8435-2f4532235dcf","year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.882068Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:1f0178f9ed0ab9bbae1a619e130b54e95b249083277bcea3ce081b182b0a152d","observation_id":"15cebc15-af5d-4676-99e0-7afd3ec6d735","resolution":{"observed_at":"2026-08-15T16:12:08.285555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.267482Z","title":"Mlaad: The multi-language audio anti-spoofing dataset,","venue":null,"work_id":"2bbf2008-8c5a-4df0-8dee-02cfe74f42db","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.886744Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:39aa8efcb350d7474a8a35f66d51d4682a63f7f2996c99d28d46843e4ade86b0","observation_id":"3203fd45-bc45-4bf6-93d3-bd0c13a2cb0f","resolution":{"observed_at":"2026-08-15T16:12:08.271714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:07.890321Z","title":"Spoofceleb: Speech deepfake detection and sasv in the wild,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.890321Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:52eb628fa9a623e1d43847b3df2221bd19a34d7a3a86c24daf94ed311467204c","observation_id":"cd856fe8-e0de-4c8c-af3f-9eca571cd888","resolution":{"observed_at":"2026-08-15T16:12:07.890321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-08-18T06:21:12.766256Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-08-15T16:12:07.893889Z","title":"Wavefake: A data set to facilitate audio deepfake detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.893889Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:fe1e8f024ed0d773cdbbbf50d3b41e728f083f86e89ac5da973b841268717efe","observation_id":"b958553b-955d-4e00-b3e1-570921e1dc69","resolution":{"observed_at":"2026-08-15T16:12:07.893889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04967","last_updated":"2024-12-11T07:40:26Z","snapshot_observed_at":"2026-08-18T03:47:15.861318Z","submitted_at":"2024-08-09T09:32:37Z","title":"ADD 2023: Towards Audio Deepfake Detection and Analysis in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04967","snapshot_observed_at":"2026-08-15T16:12:07.898425Z","title":"Add 2023: Towards audio deepfake detection and analysis in the wild,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.898425Z"},"links":{"cited_paper":"/paper/2408.04967","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:6d92bfd9bc777ac0c65dead40f6501f01884b3d759950304387fbcd9067c317b","observation_id":"df2bf722-0acb-48c3-82f9-5666bdea69a1","resolution":{"observed_at":"2026-08-15T16:12:07.898425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T16:12:07.902510Z","title":"Cosyvoice: A scal- able multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.902510Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:2ce1f1378b56d8e53e4df5df4ccd2e26d78c797587214859700d5af1063bd8ef","observation_id":"b89873c5-4c33-45c3-b7b4-b526ac52f669","resolution":{"observed_at":"2026-08-15T16:12:07.902510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T16:12:07.907763Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.907763Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:49c4817fdef87a67fc60e25dc0731f8e6d13033141119b62b2e8c7584898425a","observation_id":"33d50078-c7eb-4966-a201-23b1c93277e1","resolution":{"observed_at":"2026-08-15T16:12:07.907763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.246738Z","title":"E2 tts: Embar- rassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":"5d4bbde8-33e2-4ba3-9a79-aef59e9eb1dc","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.911774Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:5265d76f2dc09d5f497dc1834b897348f89239405146b82f79d84b5247ab9352","observation_id":"1900e16a-a597-429f-b561-2f90d9677352","resolution":{"observed_at":"2026-08-15T16:12:08.251334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-19T09:44:27.064800Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-15T16:12:07.915918Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.915918Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:68497490efb5a8412d5ebf906c46a1287604364509d7073963da82140bf966c3","observation_id":"f538a280-04ff-4a46-ae90-d03a729c2e23","resolution":{"observed_at":"2026-08-15T16:12:07.915918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-20T00:56:34.754853Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-15T16:12:07.919903Z","title":"Llasa: Scaling train-time and inference- time compute for llama-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.919903Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:deb5dcc58f9f9e9fa4d12558bd52bce0e0bf5b63e24ebef70d6278c2d422d646","observation_id":"ae85562c-0ae9-495f-841e-3716bd866b6e","resolution":{"observed_at":"2026-08-15T16:12:07.919903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T16:12:07.923921Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.923921Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:5c4323adbf4ea0683437bb2c29ca68b626046e763a93ee00032fedabb05c8773","observation_id":"751bb11e-20cb-4fe1-a0c7-cc73a5d917cc","resolution":{"observed_at":"2026-08-15T16:12:07.923921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T16:12:07.929456Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.929456Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:e759b8ac7b6043a8353f3ba52dcec6f606ab34b986f93b55aba4ec9b7c30b164","observation_id":"08be7819-1e4a-48b1-84e5-b81eb58be1f2","resolution":{"observed_at":"2026-08-15T16:12:07.929456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-20T01:09:59.849605Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-15T16:12:07.934329Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single- stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.934329Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:86f9ed1468ea9378f446abb31e855e1400726847dc7dab9c2fcd2245873a0a45","observation_id":"03362d43-70ad-431d-86e9-4539288b7823","resolution":{"observed_at":"2026-08-15T16:12:07.934329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-18T03:47:39.333317Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-15T16:12:07.939651Z","title":"Cam++: A fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.939651Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:653c86ace8015155b007130dbc36a8b6650d5a9297ccf740bfc01ae9a483febc","observation_id":"12a89d14-215e-4956-b188-0ec4e5c1a84e","resolution":{"observed_at":"2026-08-15T16:12:07.939651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-16T12:49:35.884517Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-15T16:12:07.943807Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker ver- ification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.943807Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:32cc53f47b27691f850a57639c732299bf97438e53e88fed6ae193b8c828b9a0","observation_id":"c5727956-09a2-4493-8993-ea34a1f194d3","resolution":{"observed_at":"2026-08-15T16:12:07.943807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:07.948713Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.948713Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:6ecd33cfd5710aa6ebef8aa18b84bc42bf0c88f8244012f1a15c90ae805af224","observation_id":"c9885254-0e38-4378-bdc5-1262bdcb4388","resolution":{"observed_at":"2026-08-15T16:12:07.948713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.224609Z","title":"Advancing speaker embedding learning: Wespeaker toolkit for research and production,","venue":null,"work_id":"03c088a1-f2ed-4d17-adc8-e31e4acf3279","year":2024},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.952926Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:7b4a8eb66988bece6906a2e40466f5ba9ac07dfdccf270b30d8f899212768d7b","observation_id":"e16b6319-f96a-4aaa-8c52-6a4564791a99","resolution":{"observed_at":"2026-08-15T16:12:08.229479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:12:08.209615Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"66671116-7301-479c-9da1-6d081ed09561","year":2023},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.957087Z"},"links":{"citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:8e3e588ad8e151d1492c651a2618d366b2174e25bdff47aee2a73b84ab1ae97f","observation_id":"354ab5c7-7659-489d-be5a-68415ce329f5","resolution":{"observed_at":"2026-08-15T16:12:08.215537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T13:06:12.921078Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2509.08476."}