{"as_of":"2026-08-19T18:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8b3b22e632ca4266ebee868298a5dd93a4618305ca2301f3a37f83596405dd9","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:05:30.006687Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:05:29.840446Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T21:05:30.216088Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"cited_work":{"arxiv_id":"2505.10885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.10885","snapshot_observed_at":"2026-08-15T21:05:30.216088Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","venue":"cs.SD","work_id":"dce8674d-d7d0-4d05-a0e3-f3056753ff16","year":2025},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.840446Z"},"links":{"cited_paper":"/paper/2505.10885","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:183f0d3eeb0a6efb32123ac693cd34fde0d05b8fae4e60b37757518492a766ab","observation_id":"06be47ec-fc50-4cc2-b352-3f58fdfd18e6","resolution":{"observed_at":"2026-08-15T21:05:30.221572Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10885/citation-record","integrity":"/paper/2505.10885/integrity","json":"/paper/2505.10885/citation-record.json","paper":"/paper/2505.10885"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.506019Z","title":"Auto- matic speaker verification (ASV) tools, widely used for bio- metric identification, are increasingly vulnerable to spoofing at- tacks, particularly deepfake audios","venue":null,"work_id":"0b08f523-8b39-4951-a360-15905ad1bd4c","year":2017},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.833839Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:ca660eeed347849be47f0327ae604c62a95eface9163fa517120128a603e2fca","observation_id":"69b8143c-7172-4f6b-92f6-5da069959a22","resolution":{"observed_at":"2026-08-15T21:05:30.510553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"cited_work":{"arxiv_id":"2505.10885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.10885","snapshot_observed_at":"2026-08-15T21:05:30.216088Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","venue":"cs.SD","work_id":"dce8674d-d7d0-4d05-a0e3-f3056753ff16","year":2025},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.840446Z"},"links":{"cited_paper":"/paper/2505.10885","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:183f0d3eeb0a6efb32123ac693cd34fde0d05b8fae4e60b37757518492a766ab","observation_id":"06be47ec-fc50-4cc2-b352-3f58fdfd18e6","resolution":{"observed_at":"2026-08-15T21:05:30.221572Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.492124Z","title":null,"venue":null,"work_id":"5e0076f1-0052-44b6-bde8-1911fd93644b","year":null},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.846069Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:efddff49572aa3da5a03ca2198eff3457b3248f4b50ed8d246bc9e3ad6a1493e","observation_id":"9d0c11b7-5c85-4e86-bbad-8e091623fdf7","resolution":{"observed_at":"2026-08-15T21:05:30.497138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.478088Z","title":"Later we explain how we used the trained model to create the Bangla Deepfake audio dataset","venue":null,"work_id":"d90cbce4-2894-44fa-b736-c0af9523491a","year":null},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.850293Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:2437a6be248e04c2eace18ef27bcfd0b43af95cf6a99c0d5e9c210868ef4e7bc","observation_id":"55a3a4af-aee4-42a3-9249-6dc191b42a7b","resolution":{"observed_at":"2026-08-15T21:05:30.482766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.462722Z","title":"Figure 2: t-SNE visualization of MFCC features for real and deepfake audio samples","venue":null,"work_id":"f11433bd-d698-456a-8ba1-cc955129ed26","year":null},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.855753Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:a31aa66c8d7ea68960b77696442d20c8eafb9a0a6da15af4ecd8caeebee3ac25","observation_id":"d912126e-c122-440a-9c1e-2040580c0d75","resolution":{"observed_at":"2026-08-15T21:05:30.467155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.449069Z","title":null,"venue":null,"work_id":"6fecf80e-f913-4482-bbb8-def3a9783f4e","year":null},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.863352Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:bf0684974bf45dd106f6167eaee0b4003c736f89054beecb88e192e00dfc0bad","observation_id":"fa2cfd5f-ba6f-4181-b24c-30a5e4c00848","resolution":{"observed_at":"2026-08-15T21:05:30.453830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.435628Z","title":"The average Robust-MOS scores for these questions were 3.40, and 4.01, respectively","venue":null,"work_id":"b0c4da35-aca0-4679-9529-e9706544aecc","year":null},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.868497Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:ab6676e0f538a2b98220005a48aa4104e02b2f0baf9b7625bb59e88888e31a77","observation_id":"6d67fa83-f926-435c-86d2-b7406f1239c8","resolution":{"observed_at":"2026-08-15T21:05:30.439842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.422628Z","title":null,"venue":null,"work_id":"ba99b0af-908f-4705-aa3e-b8ebee58c444","year":null},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.873119Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:4374bf37e6c478dd03c6637da13183e1cf315e4f2a3942b9e5fd098fcb35848c","observation_id":"fa6b1548-6a78-4384-8c5a-09d8ef28eec3","resolution":{"observed_at":"2026-08-15T21:05:30.426847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.408887Z","title":"Deepfakes: What are they and why would i make one?","venue":null,"work_id":"aa27abff-2fba-4290-8230-12c86f0c2f43","year":2019},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.878499Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:87278a7a0c20d0b54d2919cfe540378ff28a78f979d995c074e472bf3eb3205d","observation_id":"cf0e9587-9fc0-4639-9295-b2df22cb9c85","resolution":{"observed_at":"2026-08-15T21:05:30.413587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.393364Z","title":"Dataset pruning for resource-constrained spoofed audio detection,","venue":null,"work_id":"3724e962-ca61-49a5-b38b-f5cdafa00162","year":2022},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.883475Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:bb3c44a25e3c84d13381c74c2c6507281f69f2955686efd71eb72dafe5ff0415","observation_id":"c18de0bd-7b54-4e9e-9d4d-fc921da6e67e","resolution":{"observed_at":"2026-08-15T21:05:30.398194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06894","last_updated":"2020-03-15T18:56:19Z","snapshot_observed_at":"2026-07-06T09:04:49.235844Z","submitted_at":"2020-03-15T18:56:19Z","title":"Exploring Gaussian mixture model framework for speaker adaptation of deep neural network acoustic models","version":1},"cited_work":{"arxiv_id":"2003.06894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.06894","snapshot_observed_at":"2026-08-15T21:05:30.197857Z","title":"Exploring Gaussian mixture model framework for speaker adaptation of deep neural network acoustic models","venue":"eess.AS","work_id":"9d60739a-d55f-4745-8f1b-69f48a798978","year":2020},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.888943Z"},"links":{"cited_paper":"/paper/2003.06894","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:bd6dd2e18ae286dcc4efde105ddc02ee72c4f0fcb66d20f2d721d9035df8a8f9","observation_id":"b9a54dcd-9401-4221-aa68-ef7de98174b9","resolution":{"observed_at":"2026-08-15T21:05:30.202974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.378897Z","title":"An introduction to variational autoencoders,","venue":null,"work_id":"d63f9d36-7f50-4977-8106-3cd6402e3580","year":2019},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.894646Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:9e92ab69ee94ee2597f6d2ea9f5b5ff17bb6d19998c8aefc7b66a8bedb6838b9","observation_id":"6b93324c-a809-4013-a7d9-6383c6f8e5cb","resolution":{"observed_at":"2026-08-15T21:05:30.383110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.900172Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.900172Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:0ad5134197ac6436f04a05478ad40a053d64042efc0d321b60395503a38e664b","observation_id":"20a9c11d-27f6-41ef-b3ee-57cebb53c98f","resolution":{"observed_at":"2026-08-15T21:05:29.900172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.904729Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.904729Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:654102487159fadb62b14de72afc19726107237ce3619f767c6548fd6dee28d0","observation_id":"cd062871-c34d-4945-8d80-45fec1d4be74","resolution":{"observed_at":"2026-08-15T21:05:29.904729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.349142Z","title":"Zmm-tts: Zero-shot multi- lingual and multispeaker speech synthesis conditioned on self- supervised discrete speech representations,","venue":null,"work_id":"15894a05-6425-4f24-b84e-9e9fb863623e","year":2024},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.909223Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:fb00ff8ebe5d00b801eee99a6ac11762bbd6a4a8a6b43797ed361c009538f3f3","observation_id":"0bc36593-3922-4757-963e-7eef389e9aeb","resolution":{"observed_at":"2026-08-15T21:05:30.353681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12596","last_updated":"2023-05-27T15:15:39Z","snapshot_observed_at":"2026-08-16T15:59:19.362161Z","submitted_at":"2023-01-30T00:53:50Z","title":"Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining","version":3},"cited_work":{"arxiv_id":"2301.12596","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12596","snapshot_observed_at":"2026-08-15T21:05:30.178462Z","title":"Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining","venue":"eess.AS","work_id":"73b92173-fd3c-49e6-8fd6-13e0c5d5c033","year":2023},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.913278Z"},"links":{"cited_paper":"/paper/2301.12596","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:11a379822c70d48f0b81aa129901b7f309bc3e73502c14771c758d092140d678","observation_id":"6e62bde8-ef28-48e6-9b18-934b9b67b312","resolution":{"observed_at":"2026-08-15T21:05:30.183894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.920446Z","title":"Asvspoof 2021: accelerating progress in spoofed and deep- fake speech detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.920446Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:89dea0588274935e7efcadaa192f9b29780e53d5c0c1df8034e2e7c2d8576b9d","observation_id":"3bab4df1-a9eb-4c6d-9a19-b3cd268f8bdf","resolution":{"observed_at":"2026-08-15T21:05:29.920446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13774","last_updated":"2023-05-23T07:42:52Z","snapshot_observed_at":"2026-08-18T03:46:57.268762Z","submitted_at":"2023-05-23T07:42:52Z","title":"ADD 2023: the Second Audio Deepfake Detection Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13774","snapshot_observed_at":"2026-08-15T21:05:29.925126Z","title":"Add 2023: the second audio deepfake detection challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.925126Z"},"links":{"cited_paper":"/paper/2305.13774","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:7be1957499532d025efab4cc18ff9cc38647db6e3da1abf1dd145d76c87a04b0","observation_id":"7f05207e-7580-424a-b9b1-67e4adceedf7","resolution":{"observed_at":"2026-08-15T21:05:29.925126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04982","last_updated":"2023-10-08T03:08:25Z","snapshot_observed_at":"2026-08-16T14:54:10.019912Z","submitted_at":"2023-10-08T03:08:25Z","title":"Comparative Analysis of Transfer Learning in Deep Learning Text-to-Speech Models on a Few-Shot, Low-Resource, Customized Dataset","version":1},"cited_work":{"arxiv_id":"2310.04982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04982","snapshot_observed_at":"2026-08-15T21:05:30.141086Z","title":"Comparative Analysis of Transfer Learning in Deep Learning Text-to-Speech Models on a Few-Shot, Low-Resource, Customized Dataset","venue":"cs.SD","work_id":"ca0e6cb6-ed10-4afe-a80d-e81412eda77b","year":2023},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.930993Z"},"links":{"cited_paper":"/paper/2310.04982","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:793dbf0e19b0b292c87bfa41f9493c32e57fe77a0327f6fa1c92b7816c4a6a77","observation_id":"17d71c1d-5b2a-4740-8af4-83451e2d4d3a","resolution":{"observed_at":"2026-08-15T21:05:30.147672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-18T16:37:53.032175Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-15T21:05:29.936338Z","title":"Fakeavceleb: A novel audio-video multimodal deepfake dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.936338Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:8b3f492e5f0eac0c1331120c58d3d86efc76ddc010312fa744ea1e1807fe17a2","observation_id":"f6bbe83a-5d51-4762-a87c-23a7186b6d4a","resolution":{"observed_at":"2026-08-15T21:05:29.936338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02897","last_updated":"2024-06-10T05:50:53Z","snapshot_observed_at":"2026-08-16T13:46:03.228667Z","submitted_at":"2024-06-05T03:36:11Z","title":"LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02897","snapshot_observed_at":"2026-08-15T21:05:29.941207Z","title":"Livespeech: Low- latency zero-shot text-to-speech via autoregressive modeling of audio discrete codes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.941207Z"},"links":{"cited_paper":"/paper/2406.02897","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:6c3e18b2ad887de765a5eb226d6f04fca2c15684e7797c4407600b788a7c6ec7","observation_id":"8d982a4d-dd04-43fe-aefa-9a157736cb05","resolution":{"observed_at":"2026-08-15T21:05:29.941207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T21:05:29.946026Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.946026Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:0aa633591042540888b07d5f0ec744536a252ef46ef8e33a42afc4fab93cb256","observation_id":"f28b4e50-e54e-4914-9f46-e38c04a1701d","resolution":{"observed_at":"2026-08-15T21:05:29.946026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.328583Z","title":"Sust tts corpus: A phonetically-balanced corpus for bangla text-to-speech synthe- sis,","venue":null,"work_id":"c428a71c-578b-41b0-844b-3f7c0416b42e","year":2021},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.950720Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:6bf38dd9e85991b2aec9268e31ef25a048302f1c8af7d8ea749f7cd009de45f3","observation_id":"8e69b3f1-9967-4f29-a24c-7bec2826ece7","resolution":{"observed_at":"2026-08-15T21:05:30.332904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.954912Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.954912Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:744c4fa69dd8c8b73597cdf4c94a545af1d78f816af469f174f1c4e36eedacc5","observation_id":"450938a1-a4ec-452c-898c-6109b589d405","resolution":{"observed_at":"2026-08-15T21:05:29.954912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06103","last_updated":"2021-06-11T01:07:12Z","snapshot_observed_at":"2026-08-17T22:21:17.163186Z","submitted_at":"2021-06-11T01:07:12Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06103","snapshot_observed_at":"2026-08-15T21:05:29.959394Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.959394Z"},"links":{"cited_paper":"/paper/2106.06103","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:44ecab95f5bb726a41be09964b35022eddccb29513c3a7f44c4067469e2c3ae5","observation_id":"645aab21-c499-4830-bfed-09b8e3949e85","resolution":{"observed_at":"2026-08-15T21:05:29.959394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.963940Z","title":"The lj speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.963940Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:7feb0d21b45f043fa4f2256ca55de31d908bb43f2565f85cffb9adb943bffe33","observation_id":"57541036-3cd9-4715-bcf0-1a4ee5db4acc","resolution":{"observed_at":"2026-08-15T21:05:29.963940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.968102Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.968102Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:3ab77f47d3ac1f249f098033dd322ee7c14a8b352082280bb64062ba45fb1e5e","observation_id":"9fdfbc13-05c2-4ede-8623-14b204f9ec04","resolution":{"observed_at":"2026-08-15T21:05:29.968102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.13083","last_updated":"2021-11-22T02:52:22Z","snapshot_observed_at":"2026-08-19T18:12:29.807888Z","submitted_at":"2021-08-30T09:40:04Z","title":"An Introduction to Variational Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.13083","snapshot_observed_at":"2026-08-15T21:05:29.972115Z","title":"An introduction to variational infer- ence,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.972115Z"},"links":{"cited_paper":"/paper/2108.13083","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:ee7cf74f8a245aa0824a6d15bb79a5852649ff74511850c86f089485e2f28c9f","observation_id":"cef3d5ab-fc46-4b03-b321-45170fb9226a","resolution":{"observed_at":"2026-08-15T21:05:29.972115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.979037Z","title":"Glow-tts: A genera- tive flow for text-to-speech via monotonic alignment search,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.979037Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:e6d957b79473587b3648ef25e6481251e596bab70bc4ee4f925cb5a0b3b68e55","observation_id":"d2f9da2c-ced7-4776-9c19-ca9d760721cb","resolution":{"observed_at":"2026-08-15T21:05:29.979037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.281495Z","title":"Short term spectral analysis, synthesis, and modification by discrete fourier transform,","venue":null,"work_id":"1327f07d-8923-4649-a531-a14f79553fd3","year":1977},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.982987Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:a889bf0246baf1b63141d1f0742af0304e3e3964cf2dc1d11090975896659448","observation_id":"a2404488-d71a-4cd8-8dde-72a9e6a2793f","resolution":{"observed_at":"2026-08-15T21:05:30.285898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:29.988258Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.988258Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:9ddf5946b8107ace6c037a962b3868d99e1a72eb0025d46ea96c2d02db437bc7","observation_id":"88139a42-b6ec-442b-b243-c8efde9b1854","resolution":{"observed_at":"2026-08-15T21:05:29.988258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.258599Z","title":"Flow++: Improving flow-based generative models with variational dequan- tization and architecture design,","venue":null,"work_id":"f7e6a48e-fc74-4dbd-8fe2-788c7f93d4fb","year":2019},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.992901Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:dbec855b389718c377e908f86e4f8ae2d1c421d6e683ffb2ebd0e09ef503abf9","observation_id":"43806927-28f0-4c00-9566-ca0afdd2e2f7","resolution":{"observed_at":"2026-08-15T21:05:30.263217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-15T21:05:29.997915Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:29.997915Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:71e3bff05771c0b67df5f8e796d19f791092149b2e2e6c952ec92c2348f16f65","observation_id":"82316559-1591-44cc-ae74-77695ac532a4","resolution":{"observed_at":"2026-08-15T21:05:29.997915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.245095Z","title":"Mean opinion score (mos) revis- ited: methods and applications, limitations and alternatives,","venue":null,"work_id":"8e2b0538-ed84-4833-9897-87791fbbde4b","year":2016},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:30.002672Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:16bf972714e63c92a0f27719a27d1026d94679dbead386ab4f14262f3d9d9474","observation_id":"84bc5763-7635-40ca-8ba0-d5b2937249e4","resolution":{"observed_at":"2026-08-15T21:05:30.249399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:05:30.231505Z","title":"Visualizing data using t-sne,","venue":null,"work_id":"508cb4c4-43bd-47ad-a9fa-23fe699a13fe","year":2008},"citing_paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:05:30.006687Z"},"links":{"citing_paper":"/paper/2505.10885"},"observation_digest":"sha256:ddf6e1a5f4eb549a4512ae65b78598705464ac0bf919803b9e87a87e01e45645","observation_id":"0c3b493b-2a03-48bb-afa6-08217f9e5a99","resolution":{"observed_at":"2026-08-15T21:05:30.235735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10885","last_updated":"2025-05-16T05:42:25Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T07:02:55.640725Z","submitted_at":"2025-05-16T05:42:25Z","title":"BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2505.10885."}