{"as_of":"2026-08-16T09:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7cf2bc42a8ae1e19e8aa6a9218350af573133ec5bf7ac12de09b69a60f9b99c","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:51:21.424253Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08548/citation-record","integrity":"/paper/2412.08548/integrity","json":"/paper/2412.08548/citation-record.json","paper":"/paper/2412.08548"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.985622Z","title":"Deep learning,","venue":null,"work_id":"1dd2cb12-9c0c-48ec-9ce3-f87ef45ef92c","year":2015},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.244519Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:514306c6e1870ecdec6028dc407482f6dd6b3a640cf8eb9649328c019794e03f","observation_id":"f6a7f468-cd77-4a62-8fc8-4db1692c914b","resolution":{"observed_at":"2026-08-11T17:51:21.990365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.972069Z","title":"Deep neural networks for acoustic modeling in speech recognition,","venue":null,"work_id":"a5542400-08f4-4adc-9344-48cc0b8a2809","year":2012},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.249008Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:85cf6fb226c935c6f4fd7bee77ad6f10acdafc5076ae721f5780f85d4d1395d4","observation_id":"0343b3a1-0a43-4464-b881-be62478a7363","resolution":{"observed_at":"2026-08-11T17:51:21.977533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.959060Z","title":"Toward human parity in conversational speech recognition,","venue":null,"work_id":"29eb24cc-b61c-42fd-85b0-f56bb95c1f74","year":2017},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.253212Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:793ea176b47d7afd28621607176b4661a9b4902e418d2acc5e3ce4db869ba469","observation_id":"9c235cbb-dd50-46e3-80a6-6a83432a25ec","resolution":{"observed_at":"2026-08-11T17:51:21.963114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.946138Z","title":"English conversational telephone speech recognition by humans and machines,","venue":null,"work_id":"02ab7562-23bd-436e-b8d0-7c62a931c1bc","year":2017},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.257768Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:af81f76d5c78aca7e35beea50a0a29b04c2562c76d6cfb82d98b42a8880b1a2d","observation_id":"9a6460a5-b641-4049-8a8c-ea15ed724053","resolution":{"observed_at":"2026-08-11T17:51:21.950652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.933434Z","title":"Lessons from building acoustic models with a million hours of speech,","venue":null,"work_id":"9c65c6fe-9d1a-4ace-b3de-c294d62e14d2","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.261795Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:d9ad89fd613e06f7ada24b392d1c95d0ffe0eb6e55d4cda66113b22ba655f1e7","observation_id":"c401266a-5799-450d-8e3a-dabf70e416b3","resolution":{"observed_at":"2026-08-11T17:51:21.937765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.921211Z","title":"Re- alizing petabyte scale acoustic modeling,","venue":null,"work_id":"e3cc752c-d29a-442f-9f04-75d5066bd75c","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.265976Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:9e3b6206c62fa7f0e80b954b7396c29e20ae675b28257c60e882c4e5195036c4","observation_id":"cf9a674b-9eb6-47cd-9343-b84d20dc746f","resolution":{"observed_at":"2026-08-11T17:51:21.925256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.908237Z","title":"New types of deep neural network learning for speech recognition and related applications: An overview,","venue":null,"work_id":"0656b7ce-6a5f-4320-abb6-00065485c226","year":2013},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.270411Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:5c286470e9c4052ce7cf3ee38ff3e77fbcbef8a39ea0b2c7494bda8c4891916e","observation_id":"47997ff3-c4d2-465c-9a23-f1a8312f07bb","resolution":{"observed_at":"2026-08-11T17:51:21.912664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-11T05:38:01.369830Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-11T17:51:21.274491Z","title":"vq-wav2vec: Self- supervised learning of discrete speech representations,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.274491Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:5f2078a0624f2d374e464cece35fbe63be43a78e84b45d6b465f02471cdd8305","observation_id":"f73d5b1f-11ef-4532-a430-e588e16558cd","resolution":{"observed_at":"2026-08-11T17:51:21.274491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.278914Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.278914Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:b42e2dd2605e7fbb055a80c266ef15b60ddfd7720492c1598fdfdf94c6c6cefb","observation_id":"8fbda2a7-1f52-4416-9ca5-2d0c068aa9dc","resolution":{"observed_at":"2026-08-11T17:51:21.278914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.283045Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.283045Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:a258b7f2a515104d7087050184aa74e6a977cfb59ccde956f1799cf254e36357","observation_id":"5dc547f1-c00f-4065-9c64-1dd91f61674d","resolution":{"observed_at":"2026-08-11T17:51:21.283045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.878786Z","title":"Self-supervised learning with random-projection quantizer for speech recognition,","venue":null,"work_id":"02a8f218-b46b-4885-a6f0-da82d6e316e2","year":2022},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.286835Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:dfde8e4657661b7ba8f25ec8cfdeb5cd96e45a830905096345d61043e2d5c09b","observation_id":"ea0eeab2-1364-4dab-afb1-a0030d3f66c0","resolution":{"observed_at":"2026-08-11T17:51:21.883405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.866010Z","title":"To transfer or not to transfer,","venue":null,"work_id":"d104ad00-b689-46e6-913f-165c8e65809c","year":2005},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.290796Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:fdb399c4e0b46a9b2459dd5531080168a496bb623876e78e29de51abeef366bd","observation_id":"2c5784ef-7efc-4a90-aa9c-c729208011cf","resolution":{"observed_at":"2026-08-11T17:51:21.870289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.294560Z","title":"A survey on transfer learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.294560Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:84b20752fc7a7a4d1dc3844cdbdb803d54458c4ec33260e5b36c2b5df7502ca6","observation_id":"4c4578d0-7bc2-4aa2-b4df-bd51857e920c","resolution":{"observed_at":"2026-08-11T17:51:21.294560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.845560Z","title":"Characterizing and avoiding negative transfer,","venue":null,"work_id":"2eaea2b9-475d-453a-a95e-25c382283c98","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.298537Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:267c808916c57287536897c6dff4ffe35c4205b81ae45be820a78e29f6257c6d","observation_id":"cef5f45e-ca6b-462d-8943-b3686ccf5306","resolution":{"observed_at":"2026-08-11T17:51:21.849551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.833088Z","title":"The loss surfaces of multilayer networks,","venue":null,"work_id":"580fc72e-8f81-49a0-959e-ae6658d5df69","year":2015},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.302522Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:ecfd3e37866655b61467f8bc7434a6b5b1dcc65ec65cefa77e66fdd6a310a1ac","observation_id":"c9a16cbf-51a2-46f3-ad47-0fe650b854ec","resolution":{"observed_at":"2026-08-11T17:51:21.837295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.306276Z","title":"Investigating bi- level optimization for learning and vision from a unified perspective: A survey and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.306276Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:c9db6b377f3c7b506f756c8f916fe175fc45c2904b51cc265a7c1f4aad550c63","observation_id":"ba1d3a6d-bbed-4d15-a4e4-2b44903041a1","resolution":{"observed_at":"2026-08-11T17:51:21.306276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.814262Z","title":"Bilevel methods for image reconstruc- tion,","venue":null,"work_id":"a5b1a3eb-9e7d-44fd-85ee-4cbdbcde203b","year":2022},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.309848Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:18633f0570bcafd986f95b3cc21cfc0e3f3bd1ee25a975b3162bcdee15bc115a","observation_id":"890f50ce-65c7-4d8e-88ec-5b0a82d6a155","resolution":{"observed_at":"2026-08-11T17:51:21.818280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.801634Z","title":"Learning with limited samples: Meta-learning and applications to com- munication systems,","venue":null,"work_id":"b9c35f82-cb30-457e-a845-aa4d164abe42","year":2023},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.313573Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:ea3f15aca75ecdb44f746f8333e41b9673165a66290f1c90dd88b64a90941793","observation_id":"2b674403-1580-46a8-9f71-33ecede2bb0e","resolution":{"observed_at":"2026-08-11T17:51:21.805726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.788946Z","title":"Meta-DAG: Meta causal discovery via bilevel optimization,","venue":null,"work_id":"92cb6160-49c6-4bc6-9d33-14dc7d47fe5b","year":2023},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.317478Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:83257309648179f5227a436a1532da85da857d8b642a9fe53201070f452fc5d5","observation_id":"8af13cfd-c5cc-45d5-88d3-a6a6e0c048a7","resolution":{"observed_at":"2026-08-11T17:51:21.793384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.777030Z","title":"Bilevel programming for hyperparameter optimization and meta-learning,","venue":null,"work_id":"9b6c6673-ccd0-4b62-9c16-5fad59b4d1e5","year":2018},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.321303Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:640081a7ce5093dc1a2a004289c2c7bf11b9fd3f884b9a1bd1f04b08ea17a978","observation_id":"ed5442bb-ae75-4301-ac00-6f40eebea4f5","resolution":{"observed_at":"2026-08-11T17:51:21.781158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.764791Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks,","venue":null,"work_id":"4afb4d45-60dc-41f0-8abc-56217cf3a81f","year":2017},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.324937Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:7a5f94193890e483a953ea54b7fe38674a91b3c0a865d420b1851d91b0d526a5","observation_id":"6b3cb39a-ca9e-45a6-8c5b-96d13fb37b00","resolution":{"observed_at":"2026-08-11T17:51:21.768843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05185","last_updated":"2025-01-06T22:56:30Z","snapshot_observed_at":"2026-08-13T12:47:28.742031Z","submitted_at":"2023-02-10T11:30:19Z","title":"On Penalty-based Bilevel Gradient Descent Method","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05185","snapshot_observed_at":"2026-08-11T17:51:21.328754Z","title":"On penalty-based bilevel gradient descent method,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.328754Z"},"links":{"cited_paper":"/paper/2302.05185","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:b41b8a3bf6125c00cd8f3d12087ea4a3ccaa051997f23f4d7abc3b75620f7c3d","observation_id":"c92c7f43-e7b4-4cf0-a0c3-b99ab4d29d23","resolution":{"observed_at":"2026-08-11T17:51:21.328754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.751795Z","title":"Joint unsupervised and supervised training for multilingual ASR,","venue":null,"work_id":"5626086e-5e03-4651-9233-5c17777b885e","year":2022},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.332734Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:0b8933265cdeef8366fc3c55c850b6ffb32ae95379cdae6161f5f47920655cff","observation_id":"3ff71bd3-b266-4976-8531-c48ee785fb11","resolution":{"observed_at":"2026-08-11T17:51:21.756390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.739163Z","title":"Iterative pseudo-labeling for speech recognition,","venue":null,"work_id":"55347057-35f2-486b-9535-9adffe4a1084","year":2020},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.336508Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:f1f1be65f789b1fc5ee43c56533395acfc84996750d1e313b626fdccd4b82c7d","observation_id":"5eb65b4c-773c-4330-b951-86f256da7db8","resolution":{"observed_at":"2026-08-11T17:51:21.743298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.727101Z","title":"Joint unsupervised and supervised training for automatic speech recognition via bilevel optimization,","venue":null,"work_id":"049db006-8aa0-417e-818d-4cc9601689b1","year":2024},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.340395Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:48425501b941d8d3f162ac76a69d179f4601e98f5490d9cbb92e7935c21cb6ba","observation_id":"e8da4158-f7d9-43a3-aae5-e996c3b3b857","resolution":{"observed_at":"2026-08-11T17:51:21.731342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06440","last_updated":"2015-12-03T17:24:22Z","snapshot_observed_at":"2026-08-14T22:22:07.036855Z","submitted_at":"2015-11-19T23:04:23Z","title":"Towards Principled Unsupervised Learning","version":2},"cited_work":{"arxiv_id":"1511.06440","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.06440","snapshot_observed_at":"2026-08-11T17:51:21.501439Z","title":"Towards Principled Unsupervised Learning","venue":"cs.LG","work_id":"e677ee0f-0b4c-4581-b7c7-fa5c191290a0","year":2015},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.344073Z"},"links":{"cited_paper":"/paper/1511.06440","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:bd60e76ccc51b91b962de809af58e86a83cfbcc90b16de6f1b1854bade165519","observation_id":"55165faf-ac5e-4cf7-b0cd-5e896c997f60","resolution":{"observed_at":"2026-08-11T17:51:21.507527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.714377Z","title":"An introduction to bilevel optimization: Foundations and applications in signal processing and machine learning,","venue":null,"work_id":"81eb220c-5942-4a30-b118-573a80c0b21e","year":2024},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.348141Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:600223fda5c9580431390f57f73cc203baa5cd3cba9e454db977a73537ceaaf1","observation_id":"50c85391-7f6f-4374-b01e-31bf35d53e52","resolution":{"observed_at":"2026-08-11T17:51:21.718621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.702461Z","title":"First-order penalty methods for bilevel optimization,","venue":null,"work_id":"1425b4e3-bc10-4a35-a613-75bc51ad2354","year":1937},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.352293Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:47391a6b8a2952dea6649188a9d1cb4017420c4129022845e0c71e6f24407c03","observation_id":"943d0f42-9945-418b-89a9-351c840c5ad2","resolution":{"observed_at":"2026-08-11T17:51:21.706743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.689219Z","title":"On penalty methods for nonconvex bilevel optimization and first-order stochastic approxima- tion,","venue":null,"work_id":"4d4f0cda-fefc-4581-a9b6-7cf7d7d61a9a","year":2024},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.356255Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:02a75cce4d8060ba1480716ea9b5e4592a1f76ac9265a57e0477c1c612105682","observation_id":"0036967a-bafa-4606-9a22-68e48a2c4055","resolution":{"observed_at":"2026-08-11T17:51:21.694398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.359733Z","title":"Optimization methods for large- scale machine learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.359733Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:b2af5b80b65e27dbb0a7f49b5ba43295e3c21ccedd03b47d66503ccd997d28d1","observation_id":"bf118848-2abe-4a53-9ae3-8efdb0a631ac","resolution":{"observed_at":"2026-08-11T17:51:21.359733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-13T12:33:46.085209Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-11T17:51:21.363554Z","title":"Google USM: scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.363554Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:6d3393fac107a8242dc68f0b1654e598e6ce4b441fdbbf3fc341d5988935f991","observation_id":"dae702b4-aa12-4983-8f1d-61301ef606eb","resolution":{"observed_at":"2026-08-11T17:51:21.363554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.670603Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"06786fec-2a09-4826-a5c4-6d5f718d8089","year":2015},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.367522Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:8fd7d828e3cf554ab339c87cecc3978e0fcee9298fb97c9e63a29c2165deb24d","observation_id":"f52d87e6-5f82-47f2-9451-42220449a44c","resolution":{"observed_at":"2026-08-11T17:51:21.674819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.371166Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.371166Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:23a10d92063a707c97f3b8d6a664d6196b07ef5904b4e0cb0d34839d8f936fc1","observation_id":"1c62c306-b6e2-4cbb-acc7-975765ff2061","resolution":{"observed_at":"2026-08-11T17:51:21.371166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-11T17:51:21.375031Z","title":"Sentencepiece: A simple and language inde- pendent subword tokenizer and detokenizer for neural text processing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.375031Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:c61bed3bbb1e654d38c869317d29b6ba823a73b6ceb5f433b246928be8820d37","observation_id":"3eb7a9e6-bfcc-4613-aba8-22c4665e9f2e","resolution":{"observed_at":"2026-08-11T17:51:21.375031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.650375Z","title":"SpecAugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"aa4727f4-47b6-49f9-bcc2-be603381eb79","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.379251Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:805c4837df32fb70b19fc0a7ae1dbf9bb423545d722e3893398de98dc21bc860","observation_id":"933cb2e3-7e9a-4033-8e76-44222224a6d8","resolution":{"observed_at":"2026-08-11T17:51:21.654974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T17:51:21.383104Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.383104Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:0b67a0738980b5d7a53ff2e4f249a99b189fa9a8695637039971a8fb598dd566","observation_id":"a92f3315-df5c-4d40-a60f-cc03d2d7edd3","resolution":{"observed_at":"2026-08-11T17:51:21.383104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.387104Z","title":"Connection- ist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.387104Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:a6da2155243709e64346d07a10aa3a928ede4308edafc076fbf9093fa3a07f15","observation_id":"27cea3c8-55cd-4a29-a3dd-b740991d18c9","resolution":{"observed_at":"2026-08-11T17:51:21.387104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-11T17:51:21.390966Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.390966Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:e9f6a694d820809d012449548229f7cc1e6b8323d9b9d2f15ec93414db6e4f78","observation_id":"d916afd0-0280-4918-8f67-1d6bfa5a7c88","resolution":{"observed_at":"2026-08-11T17:51:21.390966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.631418Z","title":"Speech recognition with deep recurrent neural networks,","venue":null,"work_id":"ba09c7bf-0174-427b-92d7-a70419067869","year":2013},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.395274Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:0794dfd1472cf780564a94e465782b11526ccf45a907f793034350a8db48d3e2","observation_id":"7cd2c737-b9ce-473a-9c24-72684727596b","resolution":{"observed_at":"2026-08-11T17:51:21.635479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.619851Z","title":"Advancing RNN transducer technology for speech recognition,","venue":null,"work_id":"14e60d16-db1b-4f8f-9ab7-7385965ce638","year":2021},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.399132Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:6a7d62c9d6077e889dd65d8b047a5c9b7ca49b03f6e74f7257968b28aa2b70e4","observation_id":"46c75255-8a66-48c7-a2c5-01bd4a9de0df","resolution":{"observed_at":"2026-08-11T17:51:21.623842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.605691Z","title":"Improving RNN transducer modeling for end-to-end speech recognition,","venue":null,"work_id":"bb9315b3-e409-4951-bdb5-3ddcdcee76a0","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.403986Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:727bfd060549621eb88a4ce217d2ae37cd6ba191391cddf7b96b028cb42d17f7","observation_id":"b307aad7-347a-45ce-ad87-0a300227557b","resolution":{"observed_at":"2026-08-11T17:51:21.610973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.592798Z","title":"Sequence noise injected training for end-to-end speech recognition,","venue":null,"work_id":"f1ee2b5a-5b05-4e5a-8136-59d71bcc030f","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.407787Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:b39cb922abc8b80393ecff9adc4cb143415b75bf9cbef522b325acecb31d4d66","observation_id":"ae5b782d-3c52-4bf3-956b-79939d0662d8","resolution":{"observed_at":"2026-08-11T17:51:21.597084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.579031Z","title":"Regularization of neural networks using DropConnect,","venue":null,"work_id":"01004d91-2e35-4f68-a5db-31adf065164f","year":2013},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.412360Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:aacb65ca0ada0ac7d6dda7e07cba5395b88bf2bcf3b22f8c1b54fbbcec0ad72f","observation_id":"e1ed922b-53d6-439a-8a43-690d5f38d971","resolution":{"observed_at":"2026-08-11T17:51:21.584286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.564855Z","title":"Alignment-length synchronous decoding for RNN transducer,","venue":null,"work_id":"8691e7fc-66c3-4b41-b2b3-341aa310127c","year":2020},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.416485Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:56f5ca0c2986133a92240d2cb7b37c88dccda2c35cbe9d0a6f96f505ada7c816","observation_id":"e0147293-98e5-4030-b4c6-4e79180de1de","resolution":{"observed_at":"2026-08-11T17:51:21.569187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.551536Z","title":"ADAM: a method for stochastic optimiza- tion,","venue":null,"work_id":"78f8389b-7164-4f4c-bfd3-f33fe02e575a","year":2015},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.420469Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:618186dff4c7c4fadd2616e7ba1aabdf039caf3f733b8f02515fb5ad829f6981","observation_id":"0d9bf4ed-2e9f-48b4-ab5f-d32eb3545a65","resolution":{"observed_at":"2026-08-11T17:51:21.555767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:51:21.539102Z","title":"Super-convergence: very fast training of neural networks using large learning rates,","venue":null,"work_id":"5069efcc-b099-4af4-a06d-f31b05d66b61","year":2019},"citing_paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T17:51:21.424253Z"},"links":{"citing_paper":"/paper/2412.08548"},"observation_digest":"sha256:36ac21d7791eb12d0c26dbfb3c1e918a21ef40f040464af328c767d46fc907d9","observation_id":"9d4cc652-bc68-4167-9de6-d40e97926c15","resolution":{"observed_at":"2026-08-11T17:51:21.543268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08548","last_updated":"2024-12-11T17:06:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:21:22.976655Z","submitted_at":"2024-12-11T17:06:12Z","title":"Bilevel Joint Unsupervised and Supervised Training for Automatic Speech Recognition"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2412.08548."}