{"as_of":"2026-08-19T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1c62f9a8e3801f0024210e075983a097968a5fb33f782989bf6fdf3168ffcc6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:29:07.279462Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:53:55.761527Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-12T20:13:58.234238Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":236,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:58.234238Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:0552a10f4cd2781c7e03470890bd4d021340189cb5839cfa2b610e35d758c81b","observation_id":"5beaa773-cc2b-43ff-8413-2812414a0ebd","resolution":{"observed_at":"2026-08-12T20:13:58.234238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T21:30:10.997692Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-17T15:38:22.896172Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.997692Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:08a3ad2dac0ce3ae242c1b5a626fa67b4be8123b61957560cedc3e4bd967a2b8","observation_id":"7f08a44d-91ff-4e09-8a10-aea7e0730d3b","resolution":{"observed_at":"2026-08-11T21:30:10.997692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T17:24:22.432903Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-18T21:24:00.846989Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.432903Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:a5e9d5f9a21e2b936c8e15c139ae0421554b0f9aa5955a62d0ad62ec4ae519c0","observation_id":"aa365929-7583-4da4-924a-e36fdb2f6d70","resolution":{"observed_at":"2026-08-11T17:24:22.432903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-10T18:06:18.040748Z","title":"Yang, P.-H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11631","last_updated":"2025-01-20T18:01:42Z","snapshot_observed_at":"2026-08-18T13:07:39.042673Z","submitted_at":"2025-01-20T18:01:42Z","title":"Noise-Agnostic Multitask Whisper Training for Reducing False Alarm Errors in Call-for-Help Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:06:18.040748Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2501.11631"},"observation_digest":"sha256:927ed6f2acaf039bfc286b6c9ed6a1d5628c2a31673e8c31dcb8c7478b388ccf","observation_id":"482a3266-c427-437a-8a90-2b17a9a8bf9d","resolution":{"observed_at":"2026-08-10T18:06:18.040748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-10T14:36:19.889484Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-14T01:27:57.341623Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.889484Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:0980d4d7656ac6dd07bd4a65e0210f2f0234b0df976bb6447ebb92147d8a1ed6","observation_id":"0d6ff449-43b6-4c1b-8bc7-29e7b25f4afd","resolution":{"observed_at":"2026-08-10T14:36:19.889484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-09T19:16:37.865512Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00377","last_updated":"2025-02-01T09:29:21Z","snapshot_observed_at":"2026-08-16T09:56:33.713959Z","submitted_at":"2025-02-01T09:29:21Z","title":"When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:16:37.865512Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2502.00377"},"observation_digest":"sha256:619e348c0200e6c01dfa8418080a682a893a656f193a15a8ac68c9277ec2cc5a","observation_id":"36a1a052-2da7-43d5-a94e-3fa582a15f61","resolution":{"observed_at":"2026-08-09T19:16:37.865512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-09T04:35:12.644162Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03559","last_updated":"2025-02-07T16:51:57Z","snapshot_observed_at":"2026-08-10T11:32:08.223522Z","submitted_at":"2025-02-05T19:17:24Z","title":"Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T04:35:12.644162Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2502.03559"},"observation_digest":"sha256:81012ef31e0c06e3a69beb491afbb1649f48f03c7ca5a364c29f786ac987420a","observation_id":"784e7f01-6faf-43e2-a3e3-16adc5fa465a","resolution":{"observed_at":"2026-08-09T04:35:12.644162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T15:07:32.131218Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16212","last_updated":"2025-05-24T20:25:08Z","snapshot_observed_at":"2026-08-13T22:24:14.304830Z","submitted_at":"2025-05-22T04:28:02Z","title":"Large Language Models based ASR Error Correction for Child Conversations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:32.131218Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.16212"},"observation_digest":"sha256:66ac69fb83faffbe2f6d83e60ba72dc0ff91f9277d6feb6e9f99e60c76306d66","observation_id":"91d0c985-1dcc-433f-9059-aaa8909fc1e0","resolution":{"observed_at":"2026-08-07T15:07:32.131218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T14:12:47.829556Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-17T12:35:12.313406Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.829556Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:10d9efaf878b9a4b8f2f884a7be5eb432d0b60cad8bc10e2750d292c7cbd3171","observation_id":"c822dc6b-1ea6-4b31-a86a-eea374679c94","resolution":{"observed_at":"2026-08-07T14:12:47.829556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2505.22765","last_updated":"2026-04-07T15:07:17Z","snapshot_observed_at":"2026-08-11T13:22:19.620499Z","submitted_at":"2025-05-28T18:32:56Z","title":"StressTest: Can YOUR Speech LM Handle the Stress?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T13:00:23.002962Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.22765"},"observation_digest":"sha256:b8d5a6784c8b3725a6d595894e03cbd88f5042e558a91e684f4f2272e0aa3c60","observation_id":"23de2174-1071-4659-8a82-a16a72715415","resolution":{"observed_at":"2026-05-19T13:02:18.245043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T11:46:59.069395Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01496","last_updated":"2025-06-03T10:16:03Z","snapshot_observed_at":"2026-08-18T12:15:40.782812Z","submitted_at":"2025-06-02T09:59:35Z","title":"Continual Speech Learning with Fused Speech Features","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.069395Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2506.01496"},"observation_digest":"sha256:27b1d6b8f8ef7deea025bd53c325123aaa4c368e14c5638401626d800c459bd7","observation_id":"b7fa7fea-a8de-4bd5-b118-5815cf44f159","resolution":{"observed_at":"2026-08-07T11:46:59.069395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T04:32:30.437423Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-15T21:02:21.479218Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.437423Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:a5b463a8c53c13aab5899b82f0605eef0cbf6499108e3a42cadc78df5ea608c3","observation_id":"d8de2a0e-6168-4d88-ab94-a6a625aaacae","resolution":{"observed_at":"2026-08-07T04:32:30.437423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T20:58:31.169287Z","title":"Superb: Speech processing universal performance benchmark.arXiv preprint arXiv:2105.01051, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-14T07:12:00.142810Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.169287Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:30a0d5da3c9449f03d9b6a0d176a637eed3fa7d0964b97aedd5593e4f3b696be","observation_id":"f4a97ade-ec12-49e6-9a14-2af222fe9663","resolution":{"observed_at":"2026-08-06T20:58:31.169287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T16:47:59.287586Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-13T13:24:03.399635Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:47:59.287586Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.12705"},"observation_digest":"sha256:9fdaf1a611a4370b7c38aa251edbee8364bf51782118c80ad82cb01c07ccfe4f","observation_id":"724aaa79-c9b0-4550-bf4b-3bd285639038","resolution":{"observed_at":"2026-08-06T16:47:59.287586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T17:26:27.022505Z","title":"arXiv preprint arXiv:2105.01051 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16834","last_updated":"2025-07-15T03:42:05Z","snapshot_observed_at":"2026-08-10T18:31:56.424795Z","submitted_at":"2025-07-15T03:42:05Z","title":"Towards Robust Speech Recognition for Jamaican Patois Music Transcription","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:27.022505Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.16834"},"observation_digest":"sha256:f1d0621758991467ce6c03cd5d4eeebfbdfe532fab02f44e5933afb9b6e6fe14","observation_id":"07b7f3c5-28e0-411e-80db-09449c0dffa8","resolution":{"observed_at":"2026-08-06T17:26:27.022505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T11:07:20.126818Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.126818Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:1965c8889e793f549a15d17e599e157ddae6ae3847e060a7405ff0743b396a91","observation_id":"4660fb3d-fdf7-40e6-89ae-fe74d8854c43","resolution":{"observed_at":"2026-08-06T11:07:20.126818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:54:58.546041Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-15T15:52:55.929658Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.546041Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:9ebece583c4bd5e6d1f1e16320815e8f8e27c0957ae088b1df4177285d2a6825","observation_id":"d35525ca-2a30-43d0-9329-ae571f573311","resolution":{"observed_at":"2026-08-05T19:54:58.546041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:46:48.209823Z","title":"Superb: Speech processing universal performance benchmark.arXiv preprint arXiv:2105.01051,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11838","last_updated":"2025-09-08T04:00:52Z","snapshot_observed_at":"2026-08-14T04:56:03.376093Z","submitted_at":"2025-08-15T23:15:50Z","title":"Deformation Driven Suction Cups: A Mechanics-Based Approach to Wearable Electronics","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:46:48.209823Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11838"},"observation_digest":"sha256:a86ce5c8a1fb201bdeb860167021b3eb5582b117f16544cde88cd93988594eea","observation_id":"b381d03e-da15-48d3-bd19-0adf626e619d","resolution":{"observed_at":"2026-08-05T19:46:48.209823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2508.11845","last_updated":"2026-05-14T16:33:16Z","snapshot_observed_at":"2026-08-15T22:00:28.163317Z","submitted_at":"2025-08-15T23:52:34Z","title":"AVEX: What Matters for Animal Vocalization Encoding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T22:15:48.885339Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11845"},"observation_digest":"sha256:06a7d1a64b5a128e5543311bba3f952b2a23641354bb785d695d07cf0ede408d","observation_id":"925214f4-052a-4fc9-9a96-b3d59c39ffe5","resolution":{"observed_at":"2026-05-18T22:16:51.709697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:39:22.296512Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12221","last_updated":"2025-08-17T03:32:02Z","snapshot_observed_at":"2026-08-05T19:39:20.254888Z","submitted_at":"2025-08-17T03:32:02Z","title":"Multiple-Noise-Resilient Nonadiabatic Geometric Quantum Control of Solid-State Spins in Diamond","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:22.296512Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.12221"},"observation_digest":"sha256:53fd30243a7073bb74c4731a90277667c6d606aa264df35612e4b078bf71f3cf","observation_id":"5f4738f6-a9f9-4743-b03f-76a552e53c59","resolution":{"observed_at":"2026-08-05T19:39:22.296512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-15T17:29:07.279462Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12230","last_updated":"2025-08-17T04:06:45Z","snapshot_observed_at":"2026-08-16T08:53:21.615079Z","submitted_at":"2025-08-17T04:06:45Z","title":"Exploring Self-Supervised Audio Models for Generalized Anomalous Sound Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:29:07.279462Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.12230"},"observation_digest":"sha256:f27cfe9e98c01d55bc3a888141f93ec89a0fdd7a56b0a0a2c6b32b5a8aef4b5b","observation_id":"995b18a4-2d47-4976-ae2b-68ece4f38635","resolution":{"observed_at":"2026-08-15T17:29:07.279462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T11:41:02.892997Z","title":"J.; Lakhotia, K.; Lin, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-16T11:26:28.123684Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:02.892997Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:3d1bb4c21fb96cab3e71d00f3b490ac92e971e184d1c6150e01a29d76c968304","observation_id":"5d9a2068-4691-4b0e-a7a7-c09ff5e2cc0c","resolution":{"observed_at":"2026-08-05T11:41:02.892997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-08-15T01:16:00.421951Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:d66e5fca0de3262b8ca424dd8139f793a0562d89da3dd90bfd99fc8b1705da7f","observation_id":"a697c031-e64b-4621-b4ed-b4c604146834","resolution":{"observed_at":"2026-05-18T18:11:42.900862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-13T16:09:50.207908Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.28737","last_updated":"2026-06-20T22:01:30Z","snapshot_observed_at":"2026-08-16T17:58:07.855123Z","submitted_at":"2026-03-30T17:50:07Z","title":"ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T16:09:50.207908Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2603.28737"},"observation_digest":"sha256:5dee9bf5bda2a368e5ffdd89ce9838f9ab5eb9c4ee3bf8fcfd00f0630d81c629","observation_id":"f984d490-1f1f-4575-8b54-3c91fb536ed3","resolution":{"observed_at":"2026-07-13T16:09:50.207908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2604.06702","last_updated":"2026-04-08T05:42:03Z","snapshot_observed_at":"2026-08-16T04:48:09.028819Z","submitted_at":"2026-04-08T05:42:03Z","title":"ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:30:30.431777Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2604.06702"},"observation_digest":"sha256:04d759088635de7ba613a9b8d58ded3dd6628558f0fe9d59e81c43e23159ace6","observation_id":"9102b529-8e2c-43ce-90e9-6f0d6c407315","resolution":{"observed_at":"2026-05-11T00:25:54.281562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:3ac0db2557910b7d368e7f656799c040320e1b252b9eedc0f477be178b829faf","observation_id":"1d174128-92b1-4b5d-90be-656fa86a94bc","resolution":{"observed_at":"2026-05-11T15:41:33.505238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.10494","last_updated":"2026-05-11T12:52:29Z","snapshot_observed_at":"2026-08-09T23:13:14.574479Z","submitted_at":"2026-05-11T12:52:29Z","title":"Multi-layer attentive probing improves transfer of audio representations for bioacoustics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:11:17.994180Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.10494"},"observation_digest":"sha256:dea1adf835e210ceb8e1c16073958ba18afca77461edad5d6cc00d3585e1512a","observation_id":"2e8d27b2-891d-4f3f-bca1-e5eff96c860f","resolution":{"observed_at":"2026-05-12T06:31:28.421913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-16T15:34:58.154390Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:cd61e10711b64b39922931a581b77b9804c30ee0c9a1ad310e5816faf192be5e","observation_id":"4bcd3ac3-e213-4e36-8687-991e32b4b297","resolution":{"observed_at":"2026-05-15T01:53:28.854680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.17152","last_updated":"2026-05-16T20:56:15Z","snapshot_observed_at":"2026-08-12T11:54:49.449152Z","submitted_at":"2026-05-16T20:56:15Z","title":"Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-05-20T14:33:36.100966Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.17152"},"observation_digest":"sha256:d574d6e4dbbd9be19fa3678a2cda5ee873d6438c96ffe6647895dd3c28f4644c","observation_id":"458ee8da-b048-4de5-9728-65bcad93a99e","resolution":{"observed_at":"2026-05-20T14:38:21.758423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-13T09:27:30.095995Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:90bec796d4887e5cb778491f5f3105eed21aaf7b9fb56d48bc60dc695bcd4489","observation_id":"26975453-eb90-4d85-87ab-71f476c7aee6","resolution":{"observed_at":"2026-07-01T20:16:12.193979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-16T10:18:33.973164Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:e66be8c7a4336c255f9ad258124d5fecf46dfd83ac269769298638e98798db62","observation_id":"82c14792-db0e-40de-9be4-3c637d99cb18","resolution":{"observed_at":"2026-07-02T00:56:25.070239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.06837","last_updated":"2026-08-17T19:50:03Z","snapshot_observed_at":"2026-08-19T07:21:21.000358Z","submitted_at":"2026-06-05T02:24:19Z","title":"SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:19:56.932689Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.06837"},"observation_digest":"sha256:64ca9767fac8523c5746677ad91b9ee0340349603da1558db53442645e30a60e","observation_id":"3342e72b-077b-4df4-ae0a-95680c353790","resolution":{"observed_at":"2026-07-02T19:47:19.562187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.19398","last_updated":"2026-06-17T08:39:09Z","snapshot_observed_at":"2026-08-15T13:00:40.457818Z","submitted_at":"2026-06-17T08:39:09Z","title":"S-JEPA : Soft Clustering Anchors for Self-Supervised Speech Representation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T19:46:47.653439Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.19398"},"observation_digest":"sha256:27a35368d5f6d4746e54604a09be78cdcc93e2a14717b1ded27ad9ab389a4d7b","observation_id":"2906d0af-dab0-419d-b7fb-6f3e014dc63a","resolution":{"observed_at":"2026-07-04T02:19:24.216627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.21210","last_updated":"2026-06-26T13:32:46Z","snapshot_observed_at":"2026-08-08T14:43:47.552914Z","submitted_at":"2026-06-19T08:26:11Z","title":"Impact Analysis of Speech Representation Learning Models for Acoustic Side-Channel Attack","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:19:59.573391Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.21210"},"observation_digest":"sha256:40162c625bf9f12778a976a0fef52a216b9ead860e99af79484e6f2dad1d5b4d","observation_id":"fdcd89da-18a7-46e6-8099-6ac99c19f2e2","resolution":{"observed_at":"2026-07-04T06:39:37.328046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.21210","last_updated":"2026-06-26T13:32:46Z","snapshot_observed_at":"2026-08-08T14:43:47.552914Z","submitted_at":"2026-06-19T08:26:11Z","title":"Impact Analysis of Speech Representation Learning Models for Acoustic Side-Channel Attack","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T04:44:52.537405Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.21210"},"observation_digest":"sha256:2a4670c20d1cbf8888921b32ccb1042340c9185dfe253fdb448ae64e15e8dcd7","observation_id":"c6760762-9e33-4456-8c11-2dda8ff85c86","resolution":{"observed_at":"2026-06-29T19:33:54.408623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.22868","last_updated":"2026-06-22T05:24:35Z","snapshot_observed_at":"2026-08-14T11:36:02.442036Z","submitted_at":"2026-06-22T05:24:35Z","title":"MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T07:36:34.307652Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.22868"},"observation_digest":"sha256:54cc0296915938f75be6c6febff580e9d54280266ba0441b90688d0311b6bafe","observation_id":"e04976fb-eddd-48d7-817e-3474b7469bb9","resolution":{"observed_at":"2026-07-04T11:49:50.798715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.24910","last_updated":"2026-06-19T08:07:13Z","snapshot_observed_at":"2026-08-13T09:40:37.751064Z","submitted_at":"2026-06-19T08:07:13Z","title":"End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T13:30:12.101045Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.24910"},"observation_digest":"sha256:957bf7a64b0413be88a71b7e719b1c89e3327132c8978b5e37fd121c15031747","observation_id":"cd021a1a-d2c2-4ef3-a5e2-6faea7688acd","resolution":{"observed_at":"2026-07-04T07:29:38.212507Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.30550","last_updated":"2026-06-29T16:48:21Z","snapshot_observed_at":"2026-08-16T01:18:17.564829Z","submitted_at":"2026-06-29T16:48:21Z","title":"SIGMA: Saliency-Guided Sparse Mask Attacks for Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T04:44:59.279562Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.30550"},"observation_digest":"sha256:a6adce0ce566f8f3e008c9d7609f5c7b6d11cd977bc976afb694f330a5c50ae8","observation_id":"15289bd6-f251-4997-93be-5a9d1e8d1798","resolution":{"observed_at":"2026-06-30T16:24:57.677906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-12T13:34:06.515666Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:6e553780782ac8264ef6d8297b7e7af5f80cb04e32f30870daab52445d93f35a","observation_id":"f5bf67c4-e13c-4e07-ba87-265be4b59ea9","resolution":{"observed_at":"2026-07-02T05:56:39.882231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:f010d08caceb075b6a1911551b9a4fa36945099d416d83cf55418fa60c4a8c02","observation_id":"7963645b-9cd7-4068-b5d1-df5bcd427f8c","resolution":{"observed_at":"2026-07-07T14:53:55.763035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-01T02:57:44.725464Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25284","last_updated":"2026-07-28T04:42:05Z","snapshot_observed_at":"2026-08-18T12:00:35.196124Z","submitted_at":"2026-07-28T04:42:05Z","title":"Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:44.725464Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.25284"},"observation_digest":"sha256:3fd1ec5da08af6a522b88ae9a933869f86d6f45f7d27fb96f61a6611c674cfc9","observation_id":"b307710e-4c92-4ad4-8562-05cadfad0ae0","resolution":{"observed_at":"2026-08-01T02:57:44.725464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T15:52:34.565904Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03623","last_updated":"2026-08-06T17:30:44Z","snapshot_observed_at":"2026-08-16T02:28:51.748797Z","submitted_at":"2026-08-04T13:12:41Z","title":"Speaker Verification Under Real Classroom Conditions for English Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:34.565904Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2608.03623"},"observation_digest":"sha256:cdaec07621ad0f3cc817f0734e6b93b78344380cb608b07047712ace1a47dd60","observation_id":"00876789-57bd-4e7b-8726-22dd09ef36fa","resolution":{"observed_at":"2026-08-05T15:52:34.565904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-15T14:50:30.359241Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03623","last_updated":"2026-08-06T17:30:44Z","snapshot_observed_at":"2026-08-16T02:28:51.748797Z","submitted_at":"2026-08-04T13:12:41Z","title":"Speaker Verification Under Real Classroom Conditions for English Speech","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:50:30.359241Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2608.03623"},"observation_digest":"sha256:5fc9ec8d67645c63f1b492ae25e3f66579d42c478c6dad08130ee5d7eb680d96","observation_id":"b503bbd8-287a-4316-95cf-01a9b0185bb6","resolution":{"observed_at":"2026-08-15T14:50:30.359241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2105.01051/citation-record","integrity":"/paper/2105.01051/integrity","json":"/paper/2105.01051/citation-record.json","paper":"/paper/2105.01051"},"outbound":[],"paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2105.01051."}