{"as_of":"2026-08-15T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0131f6bc2d0e38fe1d510a0eb8c277bbbc1532a2a4451491b5a526ace8e655d","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:11.003867Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04425/citation-record","integrity":"/paper/2412.04425/integrity","json":"/paper/2412.04425/citation-record.json","paper":"/paper/2412.04425"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-14T06:46:00.873540Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-11T21:30:10.858559Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.858559Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:abaa5bd3de6fd8893af63a777442a623ce4de7d967fea8248bc232c9ab592450","observation_id":"191a3cb1-5bee-4543-8734-9b1cd2e734ff","resolution":{"observed_at":"2026-08-11T21:30:10.858559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.543875Z","title":"Neil Houlsby, Andrei Giurgiu, Stanislaw Jastrzebski, Bruna Morrone, Quentin De Laroussilhe, Andrea Gesmundo, Mona Attariyan, and Sylvain Gelly","venue":null,"work_id":"bac727c1-3237-4c02-966e-05c7f59d55b8","year":1939},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.886416Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:9fa552b15b4803ce62f0d11a97d64e062a171f4d890d5b942d09a2b073559e56","observation_id":"e29ef60a-4c47-4038-bc5c-f921c24d4f35","resolution":{"observed_at":"2026-08-11T21:30:11.551075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T21:30:10.892731Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.892731Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:c2d6084ea24d90994a6f0ebb81affacdde0144b08d341fbca1a7623a341e656e","observation_id":"59674a73-704d-4d62-9bcb-fb42240fd388","resolution":{"observed_at":"2026-08-11T21:30:10.892731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-11T21:30:10.899498Z","title":"Ctrl: A conditional transformer language model for controllable generation","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.899498Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:42fcd4e676298a4e377932e82febf2d14fecf904079c5abf7fa2dd16c495ff0c","observation_id":"37bf7a0a-85f1-4d61-8507-079cee339aa9","resolution":{"observed_at":"2026-08-11T21:30:10.899498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.522485Z","title":"A study on data augmentation of reverberant speech for robust speech recognition","venue":null,"work_id":"f5c78679-0e12-4999-8a02-7f5df295f918","year":2017},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.907151Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:cdbb31c4f7e301caa041b16c54769f7a61fb82af195713fab5d7c7cb7b1d8edb","observation_id":"eec5deaa-1c0f-4fc9-8393-d231cf4da5fa","resolution":{"observed_at":"2026-08-11T21:30:11.529143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-14T20:51:29.635557Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-11T21:30:10.922581Z","title":"V oxceleb: a large-scale speaker identifica- tion dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.922581Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:43f37ea9c1b2d6fb7ceb6cc921b0978897bc63af5031e40c5d3a6bd5ed0200ac","observation_id":"6e7b5ffb-29d9-4f1e-bc4a-668de645c949","resolution":{"observed_at":"2026-08-11T21:30:10.922581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10615","last_updated":"2025-02-24T18:06:55Z","snapshot_observed_at":"2026-08-13T11:39:52.497522Z","submitted_at":"2023-05-18T00:01:27Z","title":"ML-SUPERB: Multilingual Speech Universal PERformance Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10615","snapshot_observed_at":"2026-08-11T21:30:10.947236Z","title":"Ml-superb: Multilingual speech universal performance benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.947236Z"},"links":{"cited_paper":"/paper/2305.10615","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:e054e08d428dd229392554ce8ee434acedd7ffa28db002023a28b060a24e97a5","observation_id":"8976bf4a-5cc0-44ad-ba51-f47f190fc29d","resolution":{"observed_at":"2026-08-11T21:30:10.947236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05409","last_updated":"2022-04-11T20:59:51Z","snapshot_observed_at":"2026-08-14T02:24:40.569454Z","submitted_at":"2022-04-11T20:59:51Z","title":"Unified Speech-Text Pre-training for Speech Translation and Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05409","snapshot_observed_at":"2026-08-11T21:30:10.964761Z","title":"Unified speech-text pre-training for speech translation and recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.964761Z"},"links":{"cited_paper":"/paper/2204.05409","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:306f239fc5df4fccfc1a46441a5ad3662457faa72bc59701768b9d626283d6e6","observation_id":"8d438f6b-c4e6-47f8-9af7-8a1956bb0ec1","resolution":{"observed_at":"2026-08-11T21:30:10.964761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey.2022-30","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.044938Z","title":"URL https://www.isca-speech","venue":null,"work_id":"3481c729-c64e-43db-b8fc-ce662b1df575","year":2022},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.972131Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:d62267593a34656015691eef74939fbe309b8f841a696abfba640efa4835fb5c","observation_id":"f1a1ade0-c8b1-4b62-9572-4b7b917635ae","resolution":{"observed_at":"2026-08-11T21:30:11.052239Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-14T20:49:18.806165Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-11T21:30:10.982319Z","title":"Changhan Wang, Morgane Riviere, Ann Lee, Anne Wu, Chaitanya Talnikar, Daniel Haziza, Mary Williamson, Juan Pino, and Emmanuel Dupoux","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.982319Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:c43420a493b9645e69d78ce87479c53127c141336fd5784957257db212a3c699","observation_id":"3d464ebc-e6c3-4f03-9102-50a4f111c769","resolution":{"observed_at":"2026-08-11T21:30:10.982319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00015","last_updated":"2018-03-30T18:09:39Z","snapshot_observed_at":"2026-08-14T19:30:36.364778Z","submitted_at":"2018-03-30T18:09:39Z","title":"ESPnet: End-to-End Speech Processing Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00015","snapshot_observed_at":"2026-08-11T21:30:10.988307Z","title":"Espnet: End-to-end speech processing toolkit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.988307Z"},"links":{"cited_paper":"/paper/1804.00015","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:b6e4757dc2b1d673d439f322ba9cb831519ca5b5606913ecf9f9bb496cb2ff56","observation_id":"d40119a5-eb01-4f5b-8546-594e81ab0c35","resolution":{"observed_at":"2026-08-11T21:30:10.988307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-14T16:39:54.410651Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T21:30:10.997692Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.997692Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:85d42c9c8fb0f1fb61a16b2bce448d5b8c324c41e3e71c16e48b49aa5ec1a924","observation_id":"7f08a44d-91ff-4e09-8a10-aea7e0730d3b","resolution":{"observed_at":"2026-08-11T21:30:10.997692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T21:30:11.003867Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:11.003867Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:5a2f78851c94edd0d9fb67b4efdb973657a79ebbcf7ada83390be14cba314fce","observation_id":"f4a3b4a6-fe09-409a-a9be-767fa5445740","resolution":{"observed_at":"2026-08-11T21:30:11.003867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-08-13T16:34:38.129344Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-08-11T21:30:10.957252Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.957252Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:05d9199c93252d42772eddab2011c75560b56d6d13e19287ba9b2d6f4dc12172","observation_id":"2ff224b9-b768-4bd1-be8e-4a95eec8f86c","resolution":{"observed_at":"2026-08-11T21:30:10.957252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-08-13T17:14:34.160410Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-08-11T21:30:10.913127Z","title":"Textless speech-to-speech translation on real data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.913127Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:cb4f3e72578b442fcce8631a9b2d1200ac7c1f01dd1359b76d8f718b1bd05ee1","observation_id":"f4dced0f-5f99-4313-98ca-eee49c072582","resolution":{"observed_at":"2026-08-11T21:30:10.913127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.505074Z","title":"The 2021 NIST Speaker Recognition Evaluation","venue":null,"work_id":"081398f1-5893-459c-b617-93e56f671944","year":2021},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.930987Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:fb193ed0bd72b0a31cbef665d36536f7520c1d8e2372f129669397723171ecac","observation_id":"756c2db5-d429-4a06-97a8-49096862f754","resolution":{"observed_at":"2026-08-11T21:30:11.510249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.880147Z","title":"Brecht Desplanques, Jenthe Thienpondt, and Kris Demuynck","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.880147Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:a8617b9cc3c5d2cb0d5bcba47a9396eff6e6bd239759d0be194fc5f64776647a","observation_id":"8f9fa22a-a421-46fd-bbe6-0ca8d36b1cb3","resolution":{"observed_at":"2026-08-11T21:30:10.880147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.582986Z","title":"Accidental learners: Spoken language identification in multilingual self-supervised models","venue":null,"work_id":"5f226f47-a647-438f-8fb4-457fc1f2146e","year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.864310Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:c4bce150ff3aba4e07a9f678afe5bc7a15a2abe1d2a567cfd89358e942295027","observation_id":"161d052b-b784-4154-93af-bc289dda90c5","resolution":{"observed_at":"2026-08-11T21:30:11.589218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12765","last_updated":"2022-06-27T13:49:53Z","snapshot_observed_at":"2026-08-13T15:54:46.025382Z","submitted_at":"2022-04-27T08:35:57Z","title":"Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12765","snapshot_observed_at":"2026-08-11T21:30:10.874720Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.874720Z"},"links":{"cited_paper":"/paper/2204.12765","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:e42aae397fccc820644455cf725118f5e21ab8489c00bc3ea61a7593d32210c1","observation_id":"388d175f-7dd6-41ec-85fb-bb94691bb1dc","resolution":{"observed_at":"2026-08-11T21:30:10.874720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey.2022-45","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.067548Z","title":"Ramon Sanabria and Florian Metze","venue":null,"work_id":"b5adfdd6-06eb-4800-842b-1653fbb42d0e","year":2022},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.938234Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:2d4c8845635828bd46fe23a56a97afe2817480b888c3ee0c1e22bb842ebc1021","observation_id":"7583da53-64a5-4ba3-a19a-437816a80755","resolution":{"observed_at":"2026-08-11T21:30:11.074147Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.563509Z","title":"An exploration of self- supervised pretrained representations for end-to-end speech recognition","venue":null,"work_id":"21ad779b-6e22-480c-99a1-26ba65f2d200","year":2021},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.869151Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:99993d18b3b69d40d7dfbe107bf19e176366faa5bf7fc2244cb3b1899eb228f2","observation_id":"ce85c26e-009e-4c38-95ff-ac18a7b5f398","resolution":{"observed_at":"2026-08-11T21:30:11.569699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T06:45:51.458280Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2412.04425."}