{"as_of":"2026-08-15T09:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f90ede175b7597a353f4823e404916307d1901aedcd4630f80153644249c17d6","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:26.977695Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:27:05.187538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T17:41:06.244426Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-08-04T07:27:05.187538Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.25955","last_updated":"2026-06-22T12:55:18Z","snapshot_observed_at":"2026-08-13T09:10:45.495148Z","submitted_at":"2025-10-29T20:53:12Z","title":"SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T07:27:05.187538Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2510.25955"},"observation_digest":"sha256:2ecb7f2666642884cfdafce36699e2327072e6bb04a144a865327060df4d6ce3","observation_id":"509a8141-b875-4dfd-a562-9bf5547bf3f3","resolution":{"observed_at":"2026-08-04T07:27:05.187538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":"2506.18843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usad: Universal speech and audio representation via distillation.arXiv preprint arXiv:2506.18843","venue":null,"work_id":"7b36bf96-cc69-440d-93c0-c978e50e271f","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:70f7911275d02feaef87ccd6764e5e2f23c435462ee12bc5d726eccaae939efb","observation_id":"b3c39e7d-ebbd-417a-bfa5-7ab57dcca0a4","resolution":{"observed_at":"2026-05-11T15:41:33.721376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":"2506.18843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usad: Universal speech and audio representation via distillation.arXiv preprint arXiv:2506.18843","venue":null,"work_id":"7b36bf96-cc69-440d-93c0-c978e50e271f","year":null},"citing_paper":{"arxiv_id":"2605.04547","last_updated":"2026-05-06T06:54:00Z","snapshot_observed_at":"2026-08-11T13:48:17.888197Z","submitted_at":"2026-05-06T06:54:00Z","title":"Stage-adaptive audio diffusion modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T17:21:34.140699Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2605.04547"},"observation_digest":"sha256:2a0231aa6c2135ec8fdea0ce6a5900fae84d302f1f052199c1c05d05a8bc0061","observation_id":"adc33ca8-be64-4795-a30f-20f8f644cdb5","resolution":{"observed_at":"2026-05-11T17:41:06.248596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18843/citation-record","integrity":"/paper/2506.18843/integrity","json":"/paper/2506.18843/citation-record.json","paper":"/paper/2506.18843"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.950820Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:20.950820Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:12bc09e36445ad7d8e990b9d01b7750281fefd9fbc83d169e93ff226c0eafa56","observation_id":"9803bd2d-a80e-4467-8fd1-1bf7fce1c619","resolution":{"observed_at":"2026-08-06T23:20:20.950820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:35.069775Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"eaf21982-197b-474e-bbba-ad30a26ccc06","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.019181Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f9a9b21ae377c8a09e12d0d04f5dbcf1d9046691c282576da316a76ecb60006d","observation_id":"2857be56-1e71-4949-81eb-aaefadcbb708","resolution":{"observed_at":"2026-08-06T23:20:35.149503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.888524Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"98835d1b-dee8-4cc6-855f-9f8589683b48","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.120019Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:6b840bb4cd9cc618e0bd5802e165561c0bff6569b4e35b30b3b1ecc490432af9","observation_id":"9580200e-b490-45ad-a885-d27f022ad6f8","resolution":{"observed_at":"2026-08-06T23:20:34.969084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.684928Z","title":"Ssast: Self-supervised audio spectrogram transformer,","venue":null,"work_id":"1965df61-8c43-4e38-b821-b14fbc116a70","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.326189Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:458d4881e2ec5c1dbe6958574baa91542081879d199b7db15c38ed4b84333987","observation_id":"bd83d77f-d534-4744-998f-41adca1bfe1c","resolution":{"observed_at":"2026-08-06T23:20:34.783760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.435057Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"6da7fbc4-3a7c-47ab-a90c-3b60a9e6f1d3","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.493407Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:814f60958900e8b84648d5d365a9c456928d05074e24c6887d9ac11522597d75","observation_id":"96f93f5c-1c38-446e-9399-342e15204231","resolution":{"observed_at":"2026-08-06T23:20:34.540726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.296890Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":"3f30a481-b17b-4493-95db-49fed30ae319","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.664948Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:519993fbca16d4125a30bfcef41b50fbc436270c954cd1296fd1d44184f92cc9","observation_id":"4aa95dd6-9ff3-465d-bed9-f5714ff419ff","resolution":{"observed_at":"2026-08-06T23:20:34.366351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.087640Z","title":"Listen, think, and understand,","venue":null,"work_id":"8dbe288e-091a-45c6-a34f-e45fe4aee806","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.782308Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:c9a89bb8e794dabbd5e3e9505b7b8b845580bd3bf3d6f1d2b37b7945a09c2880","observation_id":"0ac23d43-ed8b-4c66-b5d7-b980a7db7d3a","resolution":{"observed_at":"2026-08-06T23:20:34.178286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.929062Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"89f77afe-06d5-41ae-a309-94baff9df690","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.848096Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:803743be25ec21256284bd51853babd9c91af5cb9089aa8ab3a3ec3b97d80139","observation_id":"2797e9a3-3d69-4259-a68d-31139cf72acc","resolution":{"observed_at":"2026-08-06T23:20:33.985657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.807713Z","title":"Qwen2-audio technical report,","venue":null,"work_id":"fbc7674e-4252-40d6-90e8-b5c839309459","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.989905Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:522f1f7077805d66b6de0eca359d62abb7b539d608f56087fdf85d904a40ec9b","observation_id":"adf77828-8d75-4f97-ab06-0a5b90908caa","resolution":{"observed_at":"2026-08-06T23:20:33.868863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.644004Z","title":"Gama: A large audio- language model with advanced audio understanding and complex rea- soning abilities,","venue":null,"work_id":"891f07a1-e64a-4b4f-94ce-821efa419fdd","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.121921Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:13b9003e45b01e8bf8cc86a1fec54c8c894e9134ad298e47135f1397d9d07368","observation_id":"830cc216-8902-46d8-85d0-feafef981276","resolution":{"observed_at":"2026-08-06T23:20:33.707482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.530458Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":"b5e94df6-0d98-4d93-ba73-b2e7f110d00d","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.232038Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:bebcc391dc4d3bc810e16f8c69dafd3915b3889f8fa2ab8d3d61a626dbca2020","observation_id":"ed7d1c45-9811-4b44-876c-b7527602b483","resolution":{"observed_at":"2026-08-06T23:20:33.583245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.420434Z","title":"Speechtokenizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"9bf884cd-6b1e-4bb9-b076-b467cd30b966","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.385294Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4a56f5ca30765c4cd8be5e3c7eb86e295f38a6096502dbf1667f115709d8b860","observation_id":"9b99dd78-a658-4556-8360-1871eac56571","resolution":{"observed_at":"2026-08-06T23:20:33.479959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.286594Z","title":"Soundstorm: Efficient parallel audio generation,","venue":null,"work_id":"099ec325-eefa-4b75-998d-be093b413f07","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.542181Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:058bf08015fcf0d888207e639cb1c838d32711a49fbe88b82965830237b1537c","observation_id":"1aeebdb9-51bb-4a6d-9d2e-f833a35391ac","resolution":{"observed_at":"2026-08-06T23:20:33.361483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.133728Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"41205442-fb14-404c-94d0-99134c872f1a","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.709397Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4fce4ae96b442b512a2e5ed54d829bd61ac7a6577452096ed87cc3dc7dbeb8b2","observation_id":"f1cb00c9-0acf-4673-8a29-054a36ec84dd","resolution":{"observed_at":"2026-08-06T23:20:33.210165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.012845Z","title":"Dc-spin: A speaker-invariant speech tokenizer for spoken language models,","venue":null,"work_id":"0f19fe1d-221e-4c79-adcd-2a7a0b793c6e","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.906742Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:c04e706b8f9b1ad077e41b4e239b61bdb4aeb4bf67164e809e733758182a5b99","observation_id":"d9e96910-e0ac-4769-896e-4ecfa949cbbd","resolution":{"observed_at":"2026-08-06T23:20:33.081468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.891455Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"5170493c-d62f-4cba-8347-ef2000e7fba3","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.997389Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:3433530786807c3f0670daf009e73801f2da9955c63ad19d7582230a18618684","observation_id":"a0c42ab5-3310-4048-9006-6d2db6be8ec1","resolution":{"observed_at":"2026-08-06T23:20:32.962859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.749106Z","title":"U-sam: An audio language model for unified speech, audio, and music understanding,","venue":null,"work_id":"f643c56a-e779-475d-aac7-6509d9c5e34a","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.094069Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:2551290407670e083b37bb6184201f5c63ee12864fc59e4416fd9d3d0950c553","observation_id":"af58277e-7e2c-4572-be75-91a401135ca4","resolution":{"observed_at":"2026-08-06T23:20:32.826324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.662665Z","title":"CoLLD: Contrastive layer-to-layer distillation for compressing multi- lingual pre-trained speech encoders,","venue":null,"work_id":"f1c73e8b-9e06-414f-9bfa-317aff9cddc9","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.166044Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:978ea23bee268f67a19d620d2cb0d1fa13bb97ccb895150196ceeeb5f2a4bce5","observation_id":"c3385d0f-2302-49f3-b9cb-942180b51746","resolution":{"observed_at":"2026-08-06T23:20:32.702387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.569009Z","title":"Mae-ast: Masked autoencoding audio spectrogram transformer,","venue":null,"work_id":"294b124b-98f1-4386-a734-1bca45f76bea","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.277080Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:700005a288887bbdb9aa185a1bbbfd817219c29f6656607bba14dbae0d261468","observation_id":"b2340a75-f99a-4c4b-9cc9-130ac425ffb7","resolution":{"observed_at":"2026-08-06T23:20:32.622842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.456492Z","title":"Masked spectrogram modeling using masked autoencoders for learning general-purpose audio representation,","venue":null,"work_id":"d518f5c8-2d67-4441-8f77-c90392eb17f9","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.390695Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f5c2ef07e5fe2ae2e356b8ed5919dc28c9923ecef49d92138da73efb612baa10","observation_id":"21f37735-0ccd-47d3-82be-a112d6de1950","resolution":{"observed_at":"2026-08-06T23:20:32.506691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.535235Z","title":"Masked autoencoders that listen,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.535235Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:3380a1c59e77c4d217ea296fa64ac60227492ac8de09f97a473fde1af9489a00","observation_id":"f0bd5528-3a08-4a0c-8b9b-690bcee749fe","resolution":{"observed_at":"2026-08-06T23:20:23.535235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.265977Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"0215a831-6086-41a0-bdcf-5cc108a4c40f","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.677938Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f392c7f0ed947d560cd7d91ac7bbab0683211b777186cc7c60d3a4014905144c","observation_id":"b12c6f02-375e-4ffc-9089-6363a8b22cf3","resolution":{"observed_at":"2026-08-06T23:20:32.295570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.173069Z","title":"Efficient self-supervised learning with contextualized target representations for vision, speech and language,","venue":null,"work_id":"a611573c-02f2-4162-8177-86e79828e5ea","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.826605Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:e83baacf711d195d1ed61a20a0144ff856f0981886d38eeb6aec256493fe6bc5","observation_id":"e8a8dcea-19d2-47e1-980f-e119fa9246b5","resolution":{"observed_at":"2026-08-06T23:20:32.234671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.075595Z","title":"Dinosr: Self-distillation and online clustering for self-supervised speech repre- sentation learning,","venue":null,"work_id":"4026f84a-70e1-45fa-b01f-b577d317fe81","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.957169Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:28f79b87be80bbda70fb767fe39eabd10ff9c2080dfbfca532d954e04a11f3f7","observation_id":"cb9532be-b1a9-42b2-bd44-e3c451245d5b","resolution":{"observed_at":"2026-08-06T23:20:32.101137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.975810Z","title":"Eat: Self-supervised pre-training with efficient audio transformer,","venue":null,"work_id":"f205baa1-24c3-4b7c-8198-c983f9007985","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.031734Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:9874df3245bae428e0227a5417995a0ef338e066078d6ac8a1e5cd9214eb47a7","observation_id":"2681e63e-d579-4757-b997-a9e21f2a0df1","resolution":{"observed_at":"2026-08-06T23:20:32.015670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.795491Z","title":"Sslam: Enhancing self-supervised models with audio mixtures for polyphonic soundscapes,","venue":null,"work_id":"e7d00f28-c0bb-4932-ba33-0d1f9564923a","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.185064Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:004e3c546ad30daf1b445df4aab6cea57a61e16a96385d37e864ec2d11fd5d61","observation_id":"59f5c611-2488-44ba-9586-f5601e530526","resolution":{"observed_at":"2026-08-06T23:20:31.851676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.623505Z","title":"Byol for audio: Self-supervised learning for general-purpose audio representation,","venue":null,"work_id":"437d8696-8407-4eab-9c48-a31d8f5907c9","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.281964Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:e0f80481831dadad41fdc78390dfdf472ea05ff317c7c4d734cd1d8b4ce0a0d5","observation_id":"5afdf0c6-b789-492e-9204-ea3c020b92c7","resolution":{"observed_at":"2026-08-06T23:20:31.704745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.496132Z","title":"Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,","venue":null,"work_id":"86cc1dab-4320-4d40-8ebc-4997c4ca7014","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.398795Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:82cd4a910bb9d2f6f621c67e0e39b0dc12b50cc3370d9a6efdb4e64bf6190ccc","observation_id":"0f8249ce-4a93-4bc8-a80e-58a6b4792f51","resolution":{"observed_at":"2026-08-06T23:20:31.535281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.371052Z","title":"Masked modeling duo: Learning representations by encouraging both networks to model the input,","venue":null,"work_id":"a0ded82f-05ae-494c-a12e-7fb6319b717c","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.493746Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4de9bdd471cdc61ac70a52c8ce870b297114a0cc7d615669e10ec06064bce695","observation_id":"4c8d1068-292d-4fbe-b655-ae6e422b240e","resolution":{"observed_at":"2026-08-06T23:20:31.423539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.270780Z","title":"DistilHuBERT: Speech rep- resentation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"dcc2ff11-e84a-4203-8982-34a85fd7c280","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.560928Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:e62ee9c99133dbc4384a36b702fedb31029e61751a3820f3edbb0851de21faa0","observation_id":"349d3f1f-58f9-4cf5-b2b9-7b3a0324ee33","resolution":{"observed_at":"2026-08-06T23:20:31.310082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.171466Z","title":"Dphubert: Joint dis- tillation and pruning of self-supervised speech models,","venue":null,"work_id":"732c1b3f-20d3-4f8b-b724-77a1ee266ab3","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.625963Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:c8cc9a097053403c36eb96533d3f3afd8e103d7a13318cbf2618e849816d96a4","observation_id":"13ca0c5e-f154-42ec-af26-02292cf4c903","resolution":{"observed_at":"2026-08-06T23:20:31.214849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:24.692213Z","title":"Dass: Distilled audio state space models are stronger and more duration- scalable learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.692213Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:db131ccc1259817890618574ab88d1dc51a541e34057f168cfb71587aee3b85c","observation_id":"8ce43848-a607-4024-8e75-8d684c6286a3","resolution":{"observed_at":"2026-08-06T23:20:24.692213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.015079Z","title":"Ensemble knowledge distillation of self- supervised speech models,","venue":null,"work_id":"1d68abb1-155f-4897-8e39-ee04382f1d53","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.808046Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:c36a0675ebe10066e6292c372a5c69027afe535fff06dd1c55eaed7a43c9db92","observation_id":"03653dc8-1f29-4cfd-b528-f408fdcac4a2","resolution":{"observed_at":"2026-08-06T23:20:31.064742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.775585Z","title":"Distilling a speech and music encoder with task arithmetic,","venue":null,"work_id":"2b651899-0d7f-4e97-93e7-1001f53af6d9","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.906549Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:67ddfd5c1fb29ddb3a25a66cc4daa6bff1888588048e0b7494e8985a219f8c1b","observation_id":"71239d75-3b5b-4d83-bd53-4739d01a2d80","resolution":{"observed_at":"2026-08-06T23:20:30.875657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.585055Z","title":"Attention is all you need,","venue":null,"work_id":"191b8dce-38cc-4ff9-b363-c7e19bcb94e6","year":2017},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.997035Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:8225c36df266ab188cf6ec148ea66691cbe9e47d340c1249fffd52db277aab1d","observation_id":"d0d6e2be-b8f1-4a92-a866-ce4130a97cdd","resolution":{"observed_at":"2026-08-06T23:20:30.686734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.339234Z","title":"Layer-wise analysis of a self- supervised speech representation model,","venue":null,"work_id":"6c784bb5-6cc9-4c6e-bc60-f6058768d0b1","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.069275Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:6e075e03912bcd651dddb7416f6ca0856c16ab8c993cd094c3922e45c79b0190","observation_id":"72a0f1f2-8997-4bd1-9b7f-1fa8c5e77264","resolution":{"observed_at":"2026-08-06T23:20:30.422581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:25.144389Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.144389Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d3a3c3be403174db409c73a1c63633a2d97fa4bbe4b03fbb906b7c00b7576c8e","observation_id":"29cf1ab6-5aec-43ce-ae48-0e3f82afb655","resolution":{"observed_at":"2026-08-06T23:20:25.144389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.233084Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"6a6adc34-ca65-4a21-ad2e-068a40fdcb37","year":2015},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.242305Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:3281e4e26f67ea581d686869f378cd124b796f07e6b094bb9bc8d26b286b18f0","observation_id":"aa963bdb-c1a6-4c9b-b94b-0cc331f22410","resolution":{"observed_at":"2026-08-06T23:20:30.306828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.087314Z","title":"Libri-light: A benchmark for asr with limited or no supervision,","venue":null,"work_id":"fa189f52-80b0-493f-be2d-9484f48391df","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.364102Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:6254785c5ce5cebaedd43acd73b648a8d0c13588de0cb8bb86cf41b43b7869ef","observation_id":"5b88cdb2-f84d-4909-a1e6-5f15722888ad","resolution":{"observed_at":"2026-08-06T23:20:30.157667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.871642Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":"bca072c0-5b84-4fe6-8497-a79e85cc6eab","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.477593Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:144786eeae997fff4b739edcec56c38cd84d247b158a53f43242d4b38af3383b","observation_id":"c24b73c5-4638-4bc6-8cc4-095b73dbadd2","resolution":{"observed_at":"2026-08-06T23:20:29.984380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.621087Z","title":"V oxPopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":"448175eb-a34c-4165-b3df-591df0c23851","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.592409Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:462e3be8ee959c26f924c9b5e9b05ee0efe3b33af2f5d513dface4c905116a8a","observation_id":"70e7d4af-fe2e-449f-ab09-05f17da6fb30","resolution":{"observed_at":"2026-08-06T23:20:29.730479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.376298Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":"dba9aa3f-2158-421a-8382-bc8ad28213da","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.710394Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:1b13ef89ae1dd8bd919d3b593aae0d2e91e188cf813684328c4b7bac3d8da470","observation_id":"d3bd4328-5d1c-4bef-9692-8674e551f07c","resolution":{"observed_at":"2026-08-06T23:20:29.469585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.233273Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":"4249f5e2-4e24-4013-a841-34c5fdd4dbda","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.805425Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4fdf43fb831d5696e3d823adac2b9c9fcc8e76d295b719d925dbcf727fd9cb39","observation_id":"7a3a4c6c-d745-42b7-8974-4864d027eae2","resolution":{"observed_at":"2026-08-06T23:20:29.309280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.023196Z","title":"The fisher corpus: A resource for the next generations of speech-to-text","venue":null,"work_id":"b85408cc-db9c-4e96-a128-b4747af1d6f8","year":2004},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.937214Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:5306c2c622e3a1217f74cf903f8def1d6b74a57fad570f691f55ca076ea1624a","observation_id":"3c27e679-e562-4d1b-a244-f98e5a118880","resolution":{"observed_at":"2026-08-06T23:20:29.137544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.859127Z","title":"V oxlingua107: a dataset for spoken language recognition,","venue":null,"work_id":"e5616a61-cf21-48a4-bde9-feadce0b1f4d","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.051603Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:ca69833bb4e918caf3e634586def2d51998dc17fc0afa62fd5e8c8b4e91bfbaa","observation_id":"287d4539-4ada-4f48-945e-e56defe31875","resolution":{"observed_at":"2026-08-06T23:20:28.955667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:26.141172Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.141172Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:a65e44a1133a1539aedee6d143c311576c459d81a914f6fb66c76a6e5d20f21e","observation_id":"ec99ff25-39c1-479f-af6c-f5297ae458f4","resolution":{"observed_at":"2026-08-06T23:20:26.141172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.712047Z","title":"Soundnet: Learning sound representations from unlabeled video,","venue":null,"work_id":"c3d92730-5ece-43f4-97bb-61063e778fe2","year":2016},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.187046Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:8c501b0e694bca86b97c86eca68f9cfa859b0231d04dea9cce79e0ecf3dbb45f","observation_id":"5bfdbea0-dfaa-491d-b550-6c3049143255","resolution":{"observed_at":"2026-08-06T23:20:28.794265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:26.234805Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.234805Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:a536363418fa20cfdd0510c9d6bea6f94bce60af7713e05d051c5afc5270aaac","observation_id":"cde9ede7-e5e0-4ccd-87d9-c4566b585fc0","resolution":{"observed_at":"2026-08-06T23:20:26.234805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.592629Z","title":"Music4all: A new music database and its applications,","venue":null,"work_id":"3282bd68-5b06-494c-ac5c-92dc17d647d6","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.272726Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:5b619c09f86dbfc3cc1d60980e3267ebd5254aefc9c3de09bffd954dd8116f02","observation_id":"10effc48-0b51-4139-aa79-29293a9bee66","resolution":{"observed_at":"2026-08-06T23:20:28.652831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.493843Z","title":"fairseq: A fast, extensible toolkit for sequence modeling,","venue":null,"work_id":"e6a426b2-9c8c-4d2f-ba49-f387cb9c36f7","year":2019},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.352239Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d13616fa4d9de38e86e68107ac720fe50269729a039cfda8dd3ef8a123cff282","observation_id":"38c9d75c-da90-4391-b0db-e86f3fa19f13","resolution":{"observed_at":"2026-08-06T23:20:28.543437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.339492Z","title":"Layer normalization,","venue":null,"work_id":"88f95174-82f2-40c4-a4fc-55d411c61628","year":2016},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.409954Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:96754e42db916280059bad8f64c6ce45e9430c183340ae0d8b50d09594d60269","observation_id":"f5a81b72-a1be-4027-a593-5ac2b613813c","resolution":{"observed_at":"2026-08-06T23:20:28.411742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.204577Z","title":"Self-attention with relative position representations,","venue":null,"work_id":"60626736-c25d-4d79-9137-f3ce0c5149af","year":2018},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.471051Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:141a3cd74ae2ce4e1d659b7b6431e2fe8fa9b33be287291ccfa41af522377ae1","observation_id":"b6dc93b6-4b9d-40c9-afe1-92e3732586c1","resolution":{"observed_at":"2026-08-06T23:20:28.264759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.059651Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":"683de712-1699-4911-9b0b-066f218785f5","year":2018},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.529521Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:7aee0cee8df7b616390828925423a79fe823494f1fead3188b0300fe608d0ad4","observation_id":"8f1808d9-5252-4f93-bbdd-6ed5c959396b","resolution":{"observed_at":"2026-08-06T23:20:28.140213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.843334Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":"a336cb31-8baa-43c9-898e-7f5fa6a6c3a9","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.600823Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:576cc57ab743c5c0b436faea19a7720414cb036ffbe06fc4772e852992e89fb8","observation_id":"b16ec7cc-281d-45e9-b90e-a5bac8a52c51","resolution":{"observed_at":"2026-08-06T23:20:27.959384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.664437Z","title":"SUPERB-SG: Enhanced speech processing universal PERformance benchmark for semantic and generative capabilities,","venue":null,"work_id":"f259e5e8-64f1-4b57-aba3-26a5911ef48e","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.658300Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:06de6a67d3cdfab1e06765848a85d0be5920e176ca76cb80e52d436483daef0b","observation_id":"4926ca56-4405-4134-acab-f5b787454b07","resolution":{"observed_at":"2026-08-06T23:20:27.723306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.542220Z","title":"A large-scale evaluation of speech foundation models,","venue":null,"work_id":"adb3c223-9e09-47e8-8a39-bee1a1b93123","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.722253Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:469198523b17095c0cdd537ea3499a2fd12ddea3280d9bc0ab2546ed72a5c358","observation_id":"eb20a4d8-dfbf-478c-834c-61c39d3e8eea","resolution":{"observed_at":"2026-08-06T23:20:27.603002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.410228Z","title":"Hear: Holistic evaluation of audio representations,","venue":null,"work_id":"c6589f07-c50f-4207-bde6-e5c1b69cd3cb","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.790110Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d50e268b88ae7fdb199f67c4029bb0ac04306f96a50d1a822d440c9aaba28af6","observation_id":"3ef690ab-d0ea-4524-b326-34161c0a3c03","resolution":{"observed_at":"2026-08-06T23:20:27.479424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.241621Z","title":"ESC: Dataset for Environmental Sound Classification,","venue":null,"work_id":"78a22770-a19a-4cd1-a737-4f0b53ac76e1","year":2015},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.882696Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:ffc8913110e304ff5fdb0660c631b53ff70676d26aac00788e5d5bd05a6c7406","observation_id":"20dcce66-1464-49a9-a821-5d5ab6a1bc5f","resolution":{"observed_at":"2026-08-06T23:20:27.325179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.061381Z","title":"Superb@ slt 2022: Challenge on generalization and efficiency of self-supervised speech representation learning,","venue":null,"work_id":"fc2278e5-e996-482c-87e3-364149045c0e","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.977695Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:6251dc61ecdb2d506d94c60a110015976f38ac0eee8c106549eacc6a03450542","observation_id":"1c975ef0-3fe5-43a6-bd22-1e4d3b6f7699","resolution":{"observed_at":"2026-08-06T23:20:27.152485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 3 inbound Pith citation observations for arXiv:2506.18843."}