{"as_of":"2026-08-23T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cc9b16db4499cfa022fa2b21ecb35cd1d1cbcb795db0ab0fa62b5229f6bb522","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":63,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:02:44.973306Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:30:08.546246Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:0a10dd05631437f8e533979512c93ae6e43e62dd54dbd888422df07a1943b32a","observation_id":"ce798540-d1b0-4cbd-b4b1-1e8c5ba8d8f6","resolution":{"observed_at":"2026-05-13T09:41:38.250772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-12T19:31:53.243382Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.10657","last_updated":"2024-11-16T01:34:44Z","snapshot_observed_at":"2026-08-18T07:59:29.597802Z","submitted_at":"2024-11-16T01:34:44Z","title":"Brain-to-Text Decoding with Context-Aware Neural Representations and Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:31:53.243382Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2411.10657"},"observation_digest":"sha256:e26e1bcbd66e7a5f0ad0391ffa766cd52558ef74cae112f2275928b7fd4227fb","observation_id":"1eeae4cf-6622-43e5-90c0-7fcf9e1b1aad","resolution":{"observed_at":"2026-08-12T19:31:53.243382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-12T20:13:57.978189Z","title":"wav2vec: Unsuper- vised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":185,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.978189Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:a6b8e4d4046ccf42a19a5acfb50927571e392a6bdd590ce4c0873ce1f321302c","observation_id":"c3b75942-03a6-4b9c-bd97-87e0ddbf016f","resolution":{"observed_at":"2026-08-12T20:13:57.978189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-12T14:33:49.936349Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15082","last_updated":"2024-11-22T17:18:08Z","snapshot_observed_at":"2026-08-22T12:19:30.509501Z","submitted_at":"2024-11-22T17:18:08Z","title":"Towards Speaker Identification with Minimal Dataset and Constrained Resources using 1D-Convolution Neural Network","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:33:49.936349Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2411.15082"},"observation_digest":"sha256:fbf3975457ec58347b708adef9572ec5b5c61f8286a77fca7c19b8ca05e5e6dc","observation_id":"4a5bae22-7b35-430a-8a8a-6e90caf29058","resolution":{"observed_at":"2026-08-12T14:33:49.936349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-15T06:42:40.719093Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:db742305432d686067cbb19597f740b0592e109a98cc15c1912f8fb633d35be8","observation_id":"a7dd5953-4b0f-491f-82d1-bc933439413b","resolution":{"observed_at":"2026-05-23T17:23:15.328188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-12T05:06:43.857045Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-18T10:30:20.725493Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:06:43.857045Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2412.00733"},"observation_digest":"sha256:d42ac68df3922f6d7d0c5c00c49d227b7279a7eafc21434dfaad9ffcf5f56d3e","observation_id":"3bf2902f-54f8-42b6-861d-8660cf0724d5","resolution":{"observed_at":"2026-08-12T05:06:43.857045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-11T17:49:45.797865Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08529","last_updated":"2024-12-11T16:38:48Z","snapshot_observed_at":"2026-08-17T04:17:40.884359Z","submitted_at":"2024-12-11T16:38:48Z","title":"TECO: Improving Multimodal Intent Recognition with Text Enhancement through Commonsense Knowledge Extraction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:49:45.797865Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2412.08529"},"observation_digest":"sha256:36c0e299bff9cbdcde0096998b2a86ea9447c068e4fb381ffae05d5295324569","observation_id":"ae92db97-c9e1-43cd-a818-8e7bd89ca952","resolution":{"observed_at":"2026-08-11T17:49:45.797865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-11T13:09:59.657839Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.13479","last_updated":"2024-12-18T03:42:42Z","snapshot_observed_at":"2026-08-16T16:53:47.753758Z","submitted_at":"2024-12-18T03:42:42Z","title":"Real-time One-Step Diffusion-based Expressive Portrait Videos Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T13:09:59.657839Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2412.13479"},"observation_digest":"sha256:61406679eb7a3cb0bf2875fbec37b18d1fca7a27fd99b70a960d42495808fbd9","observation_id":"6b6dc154-21c1-4a94-a3e5-ac196ba4ef52","resolution":{"observed_at":"2026-08-11T13:09:59.657839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-10T22:23:50.654728Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.01808","last_updated":"2025-01-09T02:45:43Z","snapshot_observed_at":"2026-08-18T10:24:14.556586Z","submitted_at":"2025-01-03T13:43:21Z","title":"MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:23:50.654728Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2501.01808"},"observation_digest":"sha256:20fa47351aca8c1eee80aff31a66c02f0d3f6c878c2acbeedc810e5323320319","observation_id":"9c221058-7543-4c6a-859a-f85ec72bcbe4","resolution":{"observed_at":"2026-08-10T22:23:50.654728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-10T20:35:12.967080Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-16T19:12:00.898785Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:12.967080Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:148cbb94276eee7588f778857f66548145c84c9a4b6378fc66659df17b37352a","observation_id":"dcc3f86b-bba6-49b1-bb64-2770c4ced7f2","resolution":{"observed_at":"2026-08-10T20:35:12.967080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-10T20:13:19.839014Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.09229","last_updated":"2025-01-27T20:49:14Z","snapshot_observed_at":"2026-08-19T08:28:40.345693Z","submitted_at":"2025-01-16T01:28:45Z","title":"Tessellated Linear Model for Age Prediction from Voice","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:19.839014Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2501.09229"},"observation_digest":"sha256:590976cbe126d5a25bd7063127e66b7e0dcf95b198c16e78828216d53f5f638b","observation_id":"5300cfb3-f06b-46d5-a3b3-1c0f4050d361","resolution":{"observed_at":"2026-08-10T20:13:19.839014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-10T14:48:06.562996Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.14994","last_updated":"2025-01-25T00:02:58Z","snapshot_observed_at":"2026-08-21T15:21:24.057000Z","submitted_at":"2025-01-25T00:02:58Z","title":"Robust Cross-Etiology and Speaker-Independent Dysarthric Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:48:06.562996Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2501.14994"},"observation_digest":"sha256:f9c09f05dc3f824bd21914f43e36b55656b3e557295578455b30aa8fbfe1d3da","observation_id":"a2db48f8-ec86-40b7-834a-c5a81a49ed46","resolution":{"observed_at":"2026-08-10T14:48:06.562996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-10T20:27:22.620790Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16344","last_updated":"2025-05-31T16:37:32Z","snapshot_observed_at":"2026-08-16T17:04:21.935192Z","submitted_at":"2025-01-15T06:30:17Z","title":"WhiSPA: Semantically and Psychologically Aligned Whisper with Self-Supervised Contrastive and Student-Teacher Learning","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T20:27:22.620790Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2501.16344"},"observation_digest":"sha256:f5c64b14282f524805b7b09fb3425dc46f150bd05bf02004e0a718d2303fdc0c","observation_id":"e069ab83-3241-4b8a-bd64-766445ddf959","resolution":{"observed_at":"2026-08-10T20:27:22.620790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-09T16:47:13.015378Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-20T06:05:18.569195Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T16:47:13.015378Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2502.01061"},"observation_digest":"sha256:c59e002f3a93ad2eea4110fe6361b17759486d8d647512546b50a4935dc79bd8","observation_id":"cb4deb4a-4ded-4ddd-91a1-20d164e9dcc0","resolution":{"observed_at":"2026-08-09T16:47:13.015378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-09T05:26:13.931617Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.03260","last_updated":"2025-02-05T15:16:52Z","snapshot_observed_at":"2026-08-14T16:52:13.580995Z","submitted_at":"2025-02-05T15:16:52Z","title":"Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T05:26:13.931617Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2502.03260"},"observation_digest":"sha256:387c8ffeb200665c5c42436f59e9abaf206aeeb00ab8d880db31963dad85fb95","observation_id":"e04c8143-d829-4d61-995b-dd344e649c4c","resolution":{"observed_at":"2026-08-09T05:26:13.931617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-08T14:47:07.994420Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.06664","last_updated":"2025-02-24T10:07:54Z","snapshot_observed_at":"2026-08-18T22:22:37.998321Z","submitted_at":"2025-02-10T16:51:11Z","title":"Evaluation of Deep Audio Representations for Hearables","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:47:07.994420Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2502.06664"},"observation_digest":"sha256:af7f6362a308fa05de4190a6f91fa4153324410e0d7343ebcb14ac8edfe6ef23","observation_id":"3e4e6b38-1910-4a57-a1ed-bb0b929aa685","resolution":{"observed_at":"2026-08-08T14:47:07.994420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-16T11:02:44.973306Z","title":"wav2vec: Unsupervised pre -training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.18582","last_updated":"2025-04-23T10:45:59Z","snapshot_observed_at":"2026-08-21T07:12:38.464122Z","submitted_at":"2025-04-23T10:45:59Z","title":"Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:02:44.973306Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2504.18582"},"observation_digest":"sha256:8d0675049a2a0a21ca5c009766de78401a988eeccec267232282a3d8e3c80769","observation_id":"1a6f2899-cca5-46c4-9a03-c33486018c95","resolution":{"observed_at":"2026-08-16T11:02:44.973306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-16T10:06:50.295833Z","title":"Schneider, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19030","last_updated":"2025-04-26T21:57:11Z","snapshot_observed_at":"2026-08-17T22:44:32.092983Z","submitted_at":"2025-04-26T21:57:11Z","title":"Improving Pretrained YAMNet for Enhanced Speech Command Detection via Transfer Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:06:50.295833Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2504.19030"},"observation_digest":"sha256:066816fb90ba003d41429c1909fdf9a0481b2cb01d0ae0191d6bf9897ccdba99","observation_id":"3fbe7391-59f9-4613-81fb-6e3e9b2623df","resolution":{"observed_at":"2026-08-16T10:06:50.295833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-16T00:47:52.666078Z","title":"Schneider, A","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-18T17:55:59.387301Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:47:52.666078Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.02707"},"observation_digest":"sha256:ebc2b1ea38083adba95573d8c11f584aaac41542c37affdb8aaab047f141b202","observation_id":"780d4055-048f-4c61-9f8a-fdb0d592921b","resolution":{"observed_at":"2026-08-16T00:47:52.666078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-15T23:53:10.585147Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.585147Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:9efacacd0b6cecf377f7ff104489c7ebf7b0c493abfe2870238f639e53a5133e","observation_id":"ec376700-f940-4ad6-bb8d-14b1b91cd02e","resolution":{"observed_at":"2026-08-15T23:53:10.585147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T13:42:40.142844Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.21156","last_updated":"2025-05-27T13:12:45Z","snapshot_observed_at":"2026-08-18T06:24:34.551581Z","submitted_at":"2025-05-27T13:12:45Z","title":"Model as Loss: A Self-Consistent Training Paradigm","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:40.142844Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.21156"},"observation_digest":"sha256:50da5bb99cfcf3dc57313fe0eabc4e22197a7d20b9fdb0ad13e9a3ce4434fd71","observation_id":"6c47dc4f-ccf0-487f-9318-a04e7d3f7167","resolution":{"observed_at":"2026-08-07T13:42:40.142844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T12:45:31.128176Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.23619","last_updated":"2025-05-29T16:26:32Z","snapshot_observed_at":"2026-08-14T02:11:02.447312Z","submitted_at":"2025-05-29T16:26:32Z","title":"Few-Shot Speech Deepfake Detection Adaptation with Gaussian Processes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:31.128176Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.23619"},"observation_digest":"sha256:a3d362d5a02e5e2b8ab96828d7897a1677bc64577475350854a9d1e6c28946b5","observation_id":"d3a5ef45-374b-4484-983e-4c3fa9ffc8f5","resolution":{"observed_at":"2026-08-07T12:45:31.128176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T12:43:41.747657Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.23688","last_updated":"2025-05-30T03:54:35Z","snapshot_observed_at":"2026-08-17T12:29:59.508729Z","submitted_at":"2025-05-29T17:25:35Z","title":"Automatic classification of stop realisation with wav2vec2.0","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:41.747657Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.23688"},"observation_digest":"sha256:247c78a64dc4bcd505541966ac6be7dcb6dda5cd98c96bbf49f1dc28e4752c27","observation_id":"f6496d82-3799-4a4e-b019-ed3142d7a88e","resolution":{"observed_at":"2026-08-07T12:43:41.747657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T12:29:39.796888Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-14T10:04:40.808126Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.796888Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:762732dd3126f90a114f4eb3e12ba2f1bcd73203eca84d7da8cbcb0b4271c583","observation_id":"e7f091b9-a0e6-4a24-993f-f5a1d4d7890b","resolution":{"observed_at":"2026-08-07T12:29:39.796888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T11:44:17.618021Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-22T01:23:10.048447Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.618021Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:e84a291587485df5ded1bfd19ace6c96a61be16adbaa849fdcc5ab3a8453d5dd","observation_id":"02691a0c-79b2-460b-9721-f69bf7e95692","resolution":{"observed_at":"2026-08-07T11:44:17.618021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T11:28:38.988059Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-16T07:09:53.771363Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:38.988059Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:6291cb41488d4169eb4669415d8094ed9fd5db4ec63c711f8da9df7a765a69e2","observation_id":"0cd0cc7e-cfb5-4cac-8002-73ea19f1c9e0","resolution":{"observed_at":"2026-08-07T11:28:38.988059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T11:26:04.946181Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02584","last_updated":"2025-06-03T08:04:03Z","snapshot_observed_at":"2026-08-19T08:20:08.654902Z","submitted_at":"2025-06-03T08:04:03Z","title":"Prosodic Structure Beyond Lexical Content: A Study of Self-Supervised Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:04.946181Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.02584"},"observation_digest":"sha256:d01aaa2be2664d857b4770d98adf54a73857caa95d06fd264ea2a25453b6690e","observation_id":"bbba3595-c4d5-4e38-9e09-6c455e5d1628","resolution":{"observed_at":"2026-08-07T11:26:04.946181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T10:36:56.191276Z","title":"In2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 13052– 13062, Seattle, W A, USA","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04788","last_updated":"2025-06-05T09:14:41Z","snapshot_observed_at":"2026-08-17T19:51:02.629626Z","submitted_at":"2025-06-05T09:14:41Z","title":"Towards LLM-Centric Multimodal Fusion: A Survey on Integration Strategies and Techniques","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:56.191276Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.04788"},"observation_digest":"sha256:3ffbadb18164355c932becf34341a8a2a7fc0c32685ef9196f468ea10975064e","observation_id":"eded0f9a-9741-4aa3-b944-1b04c6b765ce","resolution":{"observed_at":"2026-08-07T10:36:56.191276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T10:18:26.115489Z","title":"wav2vec: Unsupervised pre-training for speech recognition.arXiv preprint arXiv:1904.05862, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-18T10:26:01.171354Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.115489Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:99da684540e31d76936bf54c237793aba3b5a1f59de29d99d92fbfcd2adae399","observation_id":"fbf8f96b-d270-49c2-93b7-92681762c5ff","resolution":{"observed_at":"2026-08-07T10:18:26.115489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T05:19:14.039893Z","title":"Schneider, A","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:14.039893Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:a2d5f3c44b29ba1c80b23a5e2d32fdb74a2b606b4bd98685e877fc3f102985cc","observation_id":"ad2f536e-d363-4745-ab5f-ffb2d3fc48e7","resolution":{"observed_at":"2026-08-07T05:19:14.039893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T10:45:09.003341Z","title":"Available: https://arxiv.org/abs/1904.05862","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.12073","last_updated":"2025-06-05T03:06:37Z","snapshot_observed_at":"2026-08-16T07:52:10.001777Z","submitted_at":"2025-06-05T03:06:37Z","title":"Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:09.003341Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.12073"},"observation_digest":"sha256:0a8238f9cca2e4958e2207f148b1e1944bffe59649dd2dda27a2bfcf8638b8bc","observation_id":"b41b945c-92e7-4dce-9c77-ab82425a6e3f","resolution":{"observed_at":"2026-08-07T10:45:09.003341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-15T19:56:32.139392Z","title":"wav2vec: Unsupervised Pre-training for Speech Recog- nition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.14396","last_updated":"2025-07-07T03:39:01Z","snapshot_observed_at":"2026-08-17T12:29:15.837006Z","submitted_at":"2025-06-17T10:51:34Z","title":"Manipulated Regions Localization For Partially Deepfake Audio: A Survey","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:56:32.139392Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.14396"},"observation_digest":"sha256:1497b565d0633cb71386e9dea0d13af6211dc1a94548d70b4de205abed1b3fce","observation_id":"4311960b-b606-41e4-a1f4-1bd4c7ea2419","resolution":{"observed_at":"2026-08-15T19:56:32.139392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-06T20:46:26.540877Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-22T07:44:52.845100Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.540877Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:406a65c4d3d9f5f0d34a884b0ea14dcfbe3237efe7a772ad7ceecfb20904779b","observation_id":"0d44c9b3-5ea3-4053-be17-e2763b175e0f","resolution":{"observed_at":"2026-08-06T20:46:26.540877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-06T16:42:42.919123Z","title":"Schneider, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12761","last_updated":"2025-07-17T03:33:46Z","snapshot_observed_at":"2026-08-14T19:53:16.554777Z","submitted_at":"2025-07-17T03:33:46Z","title":"Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:42.919123Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2507.12761"},"observation_digest":"sha256:a6689b8fb2882b4e2a208f5c491a4c3f7047094054b22b225df54ef67e3a8e2b","observation_id":"568f8819-1c0c-4d3c-8df3-6da741a4fd4e","resolution":{"observed_at":"2026-08-06T16:42:42.919123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-06T16:13:17.511657Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.14129","last_updated":"2026-07-13T00:23:40Z","snapshot_observed_at":"2026-08-13T08:54:20.630927Z","submitted_at":"2025-07-18T17:57:46Z","title":"OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:13:17.511657Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2507.14129"},"observation_digest":"sha256:afb5c5c9470f1224c490ba6754fd382b816f0a925685fded1f66a2e6b1ea392f","observation_id":"f33d1aa8-4a70-49d7-b9a9-a28f852fa65f","resolution":{"observed_at":"2026-08-06T16:13:17.511657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-06T15:53:05.733703Z","title":"arXiv preprint arXiv:1904.05862 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16843","last_updated":"2025-07-20T03:39:09Z","snapshot_observed_at":"2026-08-22T06:27:39.255799Z","submitted_at":"2025-07-20T03:39:09Z","title":"Weak Supervision Techniques towards Enhanced ASR Models in Industry-level CRM Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:53:05.733703Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2507.16843"},"observation_digest":"sha256:d4f1b39d49cd418802ae10708a2d62bb040500c54da730381be97c8a78754e43","observation_id":"827e119e-ffb4-4984-a5d8-e2dd6d862668","resolution":{"observed_at":"2026-08-06T15:53:05.733703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-06T12:28:56.354336Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.22094","last_updated":"2025-07-29T13:41:59Z","snapshot_observed_at":"2026-08-17T23:30:12.890309Z","submitted_at":"2025-07-29T13:41:59Z","title":"Scaling and Distilling Transformer Models for sEMG","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T12:28:56.354336Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2507.22094"},"observation_digest":"sha256:ad83425b4b7a2933fdcd80300b174842ebdccef326287123d15834ff02c25cd7","observation_id":"df222587-a596-4f16-9829-02dffc8e538c","resolution":{"observed_at":"2026-08-06T12:28:56.354336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T18:50:16.266125Z","title":"Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, et al","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-18T04:45:00.241729Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.266125Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:142a69106500628e88430b4cbf5a72fcd886835f15a084e9666c394e3e84652e","observation_id":"c13b9691-63b7-4200-b309-67be32579770","resolution":{"observed_at":"2026-08-05T18:50:16.266125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T19:01:23.671306Z","title":"wav2vec: Unsupervised pre-training for speech recognition","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.14130","last_updated":"2025-08-19T06:58:16Z","snapshot_observed_at":"2026-08-20T15:11:20.438349Z","submitted_at":"2025-08-19T06:58:16Z","title":"EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T19:01:23.671306Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2508.14130"},"observation_digest":"sha256:67721609ce23e3a56b528b7761108df8d83b402f19554099e707575d7036c227","observation_id":"7f0dfb18-be61-48e4-a07e-b129e4107d22","resolution":{"observed_at":"2026-08-05T19:01:23.671306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T18:31:36.742828Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00025","last_updated":"2025-08-20T08:34:28Z","snapshot_observed_at":"2026-08-17T12:32:35.313224Z","submitted_at":"2025-08-20T08:34:28Z","title":"DeepEmoNet: Building Machine Learning Models for Automatic Emotion Recognition in Human Speeches","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T18:31:36.742828Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2509.00025"},"observation_digest":"sha256:9966e91c066cb656d8681d0f839b0cb946e824a720dbeeba13ed93314e9a76cb","observation_id":"a928eae6-f83b-420b-8800-168703fb3db6","resolution":{"observed_at":"2026-08-05T18:31:36.742828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T15:51:22.800840Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00077","last_updated":"2025-08-26T19:08:54Z","snapshot_observed_at":"2026-08-22T20:22:09.510197Z","submitted_at":"2025-08-26T19:08:54Z","title":"Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:22.800840Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2509.00077"},"observation_digest":"sha256:8d6b214d78975410ced59a4e2a58b8f9da535cb39180495378654425cfe70602","observation_id":"58a00d04-42ad-4dd7-a6ad-02046ed1ef14","resolution":{"observed_at":"2026-08-05T15:51:22.800840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T15:22:20.571864Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2509.00094","last_updated":"2025-08-27T15:28:46Z","snapshot_observed_at":"2026-08-18T20:01:40.474964Z","submitted_at":"2025-08-27T15:28:46Z","title":"Automatic Pronunciation Error Detection and Correction of the Holy Quran's Learners Using Deep Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:22:20.571864Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2509.00094"},"observation_digest":"sha256:a0f1c2c8e32471347788f8617aba9845d6010ce96754d2b3f04451607ed5dd0c","observation_id":"9fd4856e-f8aa-4d72-be37-0229cb13e30a","resolution":{"observed_at":"2026-08-05T15:22:20.571864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T13:36:05.908306Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-21T02:55:34.176877Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.908306Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:d5a7656b7427ed8020be4cb2a44edb81ff169e700f1a6558714188b6deaca371","observation_id":"2df71453-5bde-4389-8e4f-9818f88521cb","resolution":{"observed_at":"2026-08-05T13:36:05.908306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T10:16:12.074420Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04393","last_updated":"2025-09-04T17:04:44Z","snapshot_observed_at":"2026-08-09T12:46:23.066946Z","submitted_at":"2025-09-04T17:04:44Z","title":"Contextualized Token Discrimination for Speech Search Query Correction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T10:16:12.074420Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2509.04393"},"observation_digest":"sha256:56fb0038bf13e577a0fbb33d471400ed161daed779a151b2e3596c57f92911ee","observation_id":"c737ac1c-8927-4983-8369-8b7f16955cdc","resolution":{"observed_at":"2026-08-05T10:16:12.074420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-03T16:30:37.850388Z","title":"Wav2vec: Unsupervised pre-training for speech recognition.arXiv preprint arXiv:1904.05862, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-18T11:12:51.481768Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.850388Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:5b1a9b914d0d6ca30cfc54589b24a0971a6f82cf1925faa73658cf74e7ca87b1","observation_id":"8696e58f-7177-4cd2-8f24-63c0c5ab6eed","resolution":{"observed_at":"2026-08-03T16:30:37.850388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2602.19837","last_updated":"2026-05-06T07:57:45Z","snapshot_observed_at":"2026-08-14T16:37:11.701513Z","submitted_at":"2026-02-23T13:39:58Z","title":"Meta-Learning and Meta-Reinforcement Learning -- Tracing the Path towards DeepMind's Adaptive Agent","version":3},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-15T20:46:15.275441Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2602.19837"},"observation_digest":"sha256:cd816c853d5be85c3479c8e2a94e61a9c52dac62fd8428a5636d839e2eec7136","observation_id":"c3ada0bf-9a1b-410e-9062-db6b3e576a50","resolution":{"observed_at":"2026-05-15T20:46:35.635172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2603.01482","last_updated":"2026-03-02T05:45:55Z","snapshot_observed_at":"2026-07-06T22:47:28.681790Z","submitted_at":"2026-03-02T05:45:55Z","title":"A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T17:25:27.137423Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2603.01482"},"observation_digest":"sha256:5b1b6b676fde363e9037a1ec62c77e1cb188babae7e84d806354c7383e4fab48","observation_id":"accda2fa-7009-4344-9ada-51a61be75f66","resolution":{"observed_at":"2026-05-15T17:26:22.174342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2604.04496","last_updated":"2026-04-06T07:46:04Z","snapshot_observed_at":"2026-08-12T15:17:50.858153Z","submitted_at":"2026-04-06T07:46:04Z","title":"The Indra Representation Hypothesis for Multimodal Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T20:06:03.531145Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2604.04496"},"observation_digest":"sha256:5e5ef8eedc2e38d8b067b6a869b114f018222b4a79adc4b57fc877a9b9d3f1d8","observation_id":"10f075cd-643d-4c24-960f-f04cbcc4213c","resolution":{"observed_at":"2026-05-10T22:15:48.751340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2604.10181","last_updated":"2026-04-11T12:19:54Z","snapshot_observed_at":"2026-08-13T18:55:04.536786Z","submitted_at":"2026-04-11T12:19:54Z","title":"Learning to Attend to Depression-Related Patterns: An Adaptive Cross-Modal Gating Network for Depression Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:58.566821Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2604.10181"},"observation_digest":"sha256:e8e0c23795b8b1fac3d773c02a50e41bf30b5b8b7294c710b7d81dde37c3ec0a","observation_id":"130decd9-62cf-4431-958e-298031d78e5f","resolution":{"observed_at":"2026-05-11T09:51:00.710066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2605.13672","last_updated":"2026-05-13T15:32:57Z","snapshot_observed_at":"2026-08-02T22:33:46.962628Z","submitted_at":"2026-05-13T15:32:57Z","title":"SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:49.239866Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2605.13672"},"observation_digest":"sha256:fe23cb24058c2522205165123545cf8f5619fd80097863ffd0cdfad572826dc2","observation_id":"f2f67d08-f403-4fa5-a139-9ed8de2bebdd","resolution":{"observed_at":"2026-05-14T20:32:56.993740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2605.16918","last_updated":"2026-05-16T10:20:52Z","snapshot_observed_at":"2026-08-15T06:04:13.997936Z","submitted_at":"2026-05-16T10:20:52Z","title":"HighSync: High-Quality Lip Synchronization via Latent Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T21:14:25.606097Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2605.16918"},"observation_digest":"sha256:e8e4547a0c62fc02b448aa506ca757ac5d3adf7349d70ddcf3b07a91e1a7b012","observation_id":"6eb36e49-f82f-416e-a613-f46fef0c9cf7","resolution":{"observed_at":"2026-05-19T21:17:48.677029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2605.17684","last_updated":"2026-05-17T22:55:20Z","snapshot_observed_at":"2026-08-15T13:45:18.033757Z","submitted_at":"2026-05-17T22:55:20Z","title":"EGI: A Multimodal Emotional AI Framework for Enhancing Scrum Master Real-time Self-Awareness","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:50.082469Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2605.17684"},"observation_digest":"sha256:156eeeda66817424c903fbbb571d5548e58832fd87f5c28460aa9617b0dae53a","observation_id":"8c0ac0c5-0803-4aec-a953-4a25a3e1dc4e","resolution":{"observed_at":"2026-05-20T12:08:15.686763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2605.20920","last_updated":"2026-05-20T09:06:22Z","snapshot_observed_at":"2026-08-17T02:48:31.097111Z","submitted_at":"2026-05-20T09:06:22Z","title":"Evaluating Speech Articulation Synthesis with Articulatory Phoneme Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:37:41.980535Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2605.20920"},"observation_digest":"sha256:02fe4c4f1a8342aeb2b9a04de300a7b7fcbb5e6dc82e4ac0fc22b7a831e2f8bc","observation_id":"ea22beaf-3b1f-4edf-89d9-0d39535ec478","resolution":{"observed_at":"2026-05-21T04:39:35.091185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.10223","last_updated":"2026-06-08T22:22:48Z","snapshot_observed_at":"2026-08-17T23:02:11.678978Z","submitted_at":"2026-06-08T22:22:48Z","title":"Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T14:45:45.359616Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.10223"},"observation_digest":"sha256:7d8265e4b36adec0a858325724cb0fb2d746a1baaf16d3dc2d4973ea9d228051","observation_id":"12eb3e77-30c5-4fac-bb4d-63cbaf818c0f","resolution":{"observed_at":"2026-07-03T03:47:35.569440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.13260","last_updated":"2026-06-11T12:16:35Z","snapshot_observed_at":"2026-08-05T18:30:36.265406Z","submitted_at":"2026-06-11T12:16:35Z","title":"Extracting Governing Equations from Latent Dynamics via Multi-View Contrastive Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T07:30:17.092770Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.13260"},"observation_digest":"sha256:c2e2c0997c72cd4ad19bf3c7204611ccc1c26e027f98caad2912e863059434e5","observation_id":"a866f1c8-24d9-475d-a7a7-6a4db8a68998","resolution":{"observed_at":"2026-07-03T13:48:21.212460Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.25460","last_updated":"2026-06-24T06:42:29Z","snapshot_observed_at":"2026-08-02T14:52:53.073489Z","submitted_at":"2026-06-24T06:42:29Z","title":"Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T20:00:25.206417Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.25460"},"observation_digest":"sha256:a5e343b797a50467132f0bde4bef9a0a50975d01f55c11bfb2411fe5630ff87a","observation_id":"24e94bc1-9898-4567-940a-96cebad7cf17","resolution":{"observed_at":"2026-07-04T20:30:08.548256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T05:13:56.626647Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:c607daa7f17f87483929beda82b43ef3d23cba0e0dc8b525d98e232f8f5c099f","observation_id":"4e0ca598-ac30-4646-9f0a-4b12dd9ea6cb","resolution":{"observed_at":"2026-06-29T18:13:49.300052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.27748","last_updated":"2026-06-29T02:38:34Z","snapshot_observed_at":"2026-08-19T06:13:47.650368Z","submitted_at":"2026-06-26T06:08:44Z","title":"Flexformer: Flexible Linear Transformer with Learnable Attention Kernel","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T10:06:51.628147Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.27748"},"observation_digest":"sha256:e9dc8e7ba57c0e0276b5ded02a50baf16b54688829bb87d05e69324302c04ef4","observation_id":"93435d25-db93-479d-8e4f-1ab7fdc1df1a","resolution":{"observed_at":"2026-06-30T12:54:40.213982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.28857","last_updated":"2026-06-27T10:47:37Z","snapshot_observed_at":"2026-08-13T15:07:50.599799Z","submitted_at":"2026-06-27T10:47:37Z","title":"wav2VOT: Automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T08:55:16.695293Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.28857"},"observation_digest":"sha256:55b361853b1d789bdfa8c1ddd5cab11a18cfe65bace47ffd16a229064d891130","observation_id":"3bf9f104-4fb6-4c13-928f-d12585603dc3","resolution":{"observed_at":"2026-06-30T09:04:32.922022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2606.28953","last_updated":"2026-06-27T14:51:30Z","snapshot_observed_at":"2026-08-17T15:58:52.673077Z","submitted_at":"2026-06-27T14:51:30Z","title":"Clustering Unsupervised Representations as Defense against Poisoning Attacks on Speech Commands Classification System","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T08:41:24.068876Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2606.28953"},"observation_digest":"sha256:4d33513f06f06efa95e667694d96e30a4a25eeb85e0d311c42dc1bdac5a4359c","observation_id":"8cf086c1-9165-45f6-8adb-5028be3f62b0","resolution":{"observed_at":"2026-06-30T08:44:27.383983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":"1904.05862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-07-04T20:30:08.546246Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","venue":null,"work_id":"b4e617d6-db5e-4190-aeca-abe7ba1874e8","year":1904},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-12T13:34:06.515666Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:988910b99b27fa19e9dfea0160469a9b7d0566533de48298607441c3522da4a5","observation_id":"d26ce9db-c44b-433a-8ffc-a124754bf397","resolution":{"observed_at":"2026-07-02T05:56:39.839281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-01T18:37:21.698795Z","title":"arXiv preprint arXiv:1904.05862 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.17262","last_updated":"2026-07-19T14:07:43Z","snapshot_observed_at":"2026-08-21T02:21:42.149111Z","submitted_at":"2026-07-19T14:07:43Z","title":"Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T18:37:21.698795Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2607.17262"},"observation_digest":"sha256:69dd6cff87e2ba14e65e987ab0a5c80f99a4117a52e1fc15d6aa06a771f02a88","observation_id":"ce08860b-31a8-4bb5-8558-5a1c77aefc8b","resolution":{"observed_at":"2026-08-01T18:37:21.698795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-04T01:03:10.875081Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00663","last_updated":"2026-08-01T13:33:38Z","snapshot_observed_at":"2026-08-13T10:08:04.572404Z","submitted_at":"2026-08-01T13:33:38Z","title":"Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T01:03:10.875081Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2608.00663"},"observation_digest":"sha256:335cb0cffcf55eaa3aeddfbb628fb1ba8b71c53ab359a6879641218d05629a9a","observation_id":"3ceb5d73-c69e-4672-9245-0a033c51e0f7","resolution":{"observed_at":"2026-08-04T01:03:10.875081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1904.05862/citation-record","integrity":"/paper/1904.05862/integrity","json":"/paper/1904.05862/citation-record.json","paper":"/paper/1904.05862"},"outbound":[],"paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 63 inbound Pith citation observations for arXiv:1904.05862."}