{"as_of":"2026-08-09T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fae029fdb84a1415721193fede986cf8092761026490afb7632449b827ca2a7","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:03:27.681630Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:03:25.586931Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.20023","snapshot_observed_at":"2026-08-01T11:03:25.586931Z","title":"Feature Fusion Methods We implement aFeature Fusion(FF) method based on [8] for comparative analysis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.586931Z"},"links":{"cited_paper":"/paper/2607.20023","citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:000e9a4aec05d2b1c2b3ac4a9114c95cedec6429a2c7bb77348d8842b7e5754b","observation_id":"c75ba3a0-bec4-454c-a025-4e0a03f3a8ac","resolution":{"observed_at":"2026-08-01T11:03:25.586931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.20023/citation-record","integrity":"/paper/2607.20023/integrity","json":"/paper/2607.20023/citation-record.json","paper":"/paper/2607.20023"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:25.493140Z","title":"While modern FAD systems can achieve high in-domain performance, a main challenge lies in their generalization abil- ities [1]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.493140Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:2224d814b621a2c6ffa59db710dd471efab6f0e2aaf3e29546339a8880964724","observation_id":"8238aa00-5913-498a-9829-de4d79dfca83","resolution":{"observed_at":"2026-08-01T11:03:25.493140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.20023","snapshot_observed_at":"2026-08-01T11:03:25.586931Z","title":"Feature Fusion Methods We implement aFeature Fusion(FF) method based on [8] for comparative analysis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.586931Z"},"links":{"cited_paper":"/paper/2607.20023","citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:000e9a4aec05d2b1c2b3ac4a9114c95cedec6429a2c7bb77348d8842b7e5754b","observation_id":"c75ba3a0-bec4-454c-a025-4e0a03f3a8ac","resolution":{"observed_at":"2026-08-01T11:03:25.586931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:25.666695Z","title":"The latter uses a learn- able weight vectorα∈R L, normalized via softmax","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.666695Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:96a34928c0e9a5e234b934f57af3c16c6fee26dfe6b0528ee9c0ff43b5561136","observation_id":"0c2da291-b29c-4760-a15d-0ffe526dbff5","resolution":{"observed_at":"2026-08-01T11:03:25.666695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:25.717494Z","title":"The ASVspoof19 LA contains clean, high-quality recordings with spoofed speech generated using TTS and VC methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.717494Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:1450621f1580c4164ec1b2c19b844776daae1155dfbf55fb97679c535f0b768e","observation_id":"c13aa241-1516-4f48-b8cb-ae40f4def93f","resolution":{"observed_at":"2026-08-01T11:03:25.717494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:25.782546Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.782546Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:6bd52031a3b20a02d21ee902e384a463fc5e16252aa45811118034614f24f9e3","observation_id":"8d98c4ed-c885-4ee4-bfd4-b2abc1dda2bf","resolution":{"observed_at":"2026-08-01T11:03:25.782546Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.086802Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.086802Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:a51e6f9c9a1ec4c74a1005c94ea32f37253c49caa1894ca4c00dad638bc97c70","observation_id":"c2ae2bf1-bea9-4dd1-bfab-c26106ed2160","resolution":{"observed_at":"2026-08-01T11:03:26.086802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:25.861656Z","title":"However, as the model ca- pacity increases (e.g., from 300M to 2B parameter models used in [7]), performance improves noticeably","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.861656Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:ef28dedd6ae39d259d6adbcb54edc6e2baec66c2e679143bfc6210533be8ac2c","observation_id":"c4d75fd2-d891-4a18-9847-0614043b7b93","resolution":{"observed_at":"2026-08-01T11:03:25.861656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:25.971974Z","title":"important","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:25.971974Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:0cab87c9eaaa226d0755245f29a43f073f2de64b8953e4754f4f7244040929f0","observation_id":"ed9dfaa0-f65c-4bd5-8529-3ac0f6ba3640","resolution":{"observed_at":"2026-08-01T11:03:25.971974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.032551Z","title":"activated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.032551Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:b8b4fe1eebcdda17cff436e206d6ac74688c9b90878a72efc2e9fb9a84b068cd","observation_id":"2e6adbc8-e2d3-4b60-b774-fa50c45a315c","resolution":{"observed_at":"2026-08-01T11:03:26.032551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.135615Z","title":"Does audio deepfake detection generalize?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.135615Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:47574a76c0f662194e0667036e3c34ec3501fa58ac225a33a2197a887d039056","observation_id":"734cbb48-f812-4140-adf5-3a667f23cfc8","resolution":{"observed_at":"2026-08-01T11:03:26.135615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.206338Z","title":"One-class learning towards synthetic voice spoofing detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.206338Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:73d4a61213f174bb419779fc34744bd4b5a3c99f02ed4e90b5f9cf1ed6d53222","observation_id":"b71e4e27-64df-4c17-8128-0b0352be0ce5","resolution":{"observed_at":"2026-08-01T11:03:26.206338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16716","last_updated":"2024-06-24T15:21:50Z","snapshot_observed_at":"2026-08-07T00:55:01.626533Z","submitted_at":"2024-06-24T15:21:50Z","title":"One-Class Learning with Adaptive Centroid Shift for Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16716","snapshot_observed_at":"2026-08-01T11:03:26.284103Z","title":"One-class learning with adaptive centroid shift for audio deepfake detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.284103Z"},"links":{"cited_paper":"/paper/2406.16716","citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:0ed0acda4610364886ec0a5d6ffeb200586f49ba9d0c7109d20d7626cd0b1e9b","observation_id":"04248a6d-be7d-472b-9d42-33af8231acf7","resolution":{"observed_at":"2026-08-01T11:03:26.284103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.368056Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.368056Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:e4680a02b0b698ba9b7d1dc28c354624e84c9ce6a8a542744cf8955050ef0d0f","observation_id":"427c5190-3e77-4bf6-a651-21775d857735","resolution":{"observed_at":"2026-08-01T11:03:26.368056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.442690Z","title":"XLS-R: self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.442690Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:d6d14fed93566fa4b28097d230531902a147985764bd83faf3ea6382d62ea563","observation_id":"02771db3-2a12-426d-ae72-71a4a372ffbf","resolution":{"observed_at":"2026-08-01T11:03:26.442690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.558103Z","title":"Wavlm: Large- scale self-supervised pre-training for full stack speech process- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.558103Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:8670d86445fe1f90de822d364b1b4627d6f8ea32700dc59f8dcbbc86e9626656","observation_id":"bb55985e-2ab7-4328-adc5-beea876420a2","resolution":{"observed_at":"2026-08-01T11:03:26.558103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.624919Z","title":"Towards generalisable and calibrated audio deepfake detection with self- supervised representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.624919Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:5df6e3f7feee4739a170c2a979a637e64805280f5239f4a5716d886ace6a8c8d","observation_id":"e58db814-2626-4900-bc8b-3eace462f200","resolution":{"observed_at":"2026-08-01T11:03:26.624919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.802393Z","title":"Exploring self-supervised embeddings and syn- thetic data augmentation for robust audio deepfake detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.802393Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:f74cff01be4970c0973e9dafaf04ad5f8f27e27cdfa83cddfabf9603400e72eb","observation_id":"1ce5eec0-d215-4ae5-b358-1fce8946a621","resolution":{"observed_at":"2026-08-01T11:03:26.802393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.860669Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.860669Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:96aff59a81285a8849305aef516dc9e5c204b52d3c431d8117aeb664e3a915c5","observation_id":"de237c29-f4f3-4d09-8581-dee6dce0ea43","resolution":{"observed_at":"2026-08-01T11:03:26.860669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:26.914737Z","title":"Comparative layer-wise anal- ysis of self-supervised speech models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:26.914737Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:ef14747b36db53b2f7ec5d659b48fdee5c152c2d6b00e9ad9ab4805c61ff8f33","observation_id":"f1af0542-b04f-4f37-925d-e774bb852309","resolution":{"observed_at":"2026-08-01T11:03:26.914737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:27.020999Z","title":"Spoofed training data for speech spoofing countermeasure can be efficiently created using neu- ral vocoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.020999Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:b436bcfa4adb97ea37d7b0adda4cd75449f788311bfb801ba1cea2293f42e087","observation_id":"077fa012-da13-40ed-81e4-95da1e1c8690","resolution":{"observed_at":"2026-08-01T11:03:27.020999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:27.170712Z","title":"Attentive merging of hidden embeddings from pre-trained speech model for anti- spoofing detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.170712Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:812a0389a66ad1a7f7a515073c84a9f5390602e04464d55e4804cb7d646cceb4","observation_id":"830ff966-a203-4caf-a4d4-1b4c8b1d844a","resolution":{"observed_at":"2026-08-01T11:03:27.170712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05991","last_updated":"2021-04-03T11:18:12Z","snapshot_observed_at":"2026-07-06T09:04:19.750585Z","submitted_at":"2020-03-12T19:38:47Z","title":"Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.05991","snapshot_observed_at":"2026-08-01T11:03:27.325123Z","title":"Autoencoders,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.325123Z"},"links":{"cited_paper":"/paper/2003.05991","citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:4ec232cb10137546360d333ffada425aebf37f6a928b1c83184a9b2f17008067","observation_id":"be26a977-6e21-4710-a6af-49dfa09d147d","resolution":{"observed_at":"2026-08-01T11:03:27.325123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:27.383814Z","title":"Asvspoof 2019: A large-scale public database of synthesized, converted and replayed speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.383814Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:655a8df3f72770b325630818ca51d5376ed2013a39f6d3dbde4a3101dd71f29c","observation_id":"690c84c5-0f36-4664-a575-df1c45b99165","resolution":{"observed_at":"2026-08-01T11:03:27.383814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:27.435866Z","title":"End-to-end anti-spoofing with rawnet2,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.435866Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:1e329f0ef9013a73dd64e49da261633f08944d92749957a00559fd4541475c5f","observation_id":"11c5db8c-4cec-403a-b2a1-711698ab7c17","resolution":{"observed_at":"2026-08-01T11:03:27.435866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:27.516883Z","title":"Rawboost: A raw data boosting and augmentation method ap- plied to automatic speaker verification anti-spoofing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.516883Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:a483eb423be52f26f2b7718a340d54a815c8efc32348123c0dc32c789dce8839","observation_id":"d2627e8e-32d9-4201-9b34-e0f81bdcaa70","resolution":{"observed_at":"2026-08-01T11:03:27.516883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12914","last_updated":"2021-09-28T09:06:33Z","snapshot_observed_at":"2026-07-06T11:22:29.069903Z","submitted_at":"2021-06-23T08:28:59Z","title":"Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12914","snapshot_observed_at":"2026-08-01T11:03:27.603106Z","title":"Speech is silver, silence is golden: What do asvspoof-trained models really learn?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.603106Z"},"links":{"cited_paper":"/paper/2106.12914","citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:5bd513c54576b128298ab69281ea06ec2d85017781202417a7b217563e5ecd74","observation_id":"04b91278-7924-4940-842e-a029f3932e61","resolution":{"observed_at":"2026-08-01T11:03:27.603106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:03:27.681630Z","title":"An information-theoretic analysis of self-supervised discrete repre- sentations of speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:03:27.681630Z"},"links":{"citing_paper":"/paper/2607.20023"},"observation_digest":"sha256:88b567a5e0b924bb93e2defa72b2d154a3b353caa518bac6dfc8bb9b8293c591","observation_id":"5bef476e-aa43-4f30-83db-3bad8ccc952c","resolution":{"observed_at":"2026-08-01T11:03:27.681630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20023","last_updated":"2026-07-22T11:05:04Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-01T11:03:24.095466Z","submitted_at":"2026-07-22T11:05:04Z","title":"Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2607.20023."}