{"as_of":"2026-08-17T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6be43f765865eb499dd7f494134f9f1a1fbb8eb99f44b92740d8690d8455feb6","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:20:04.427870Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10031/citation-record","integrity":"/paper/2509.10031/integrity","json":"/paper/2509.10031/citation-record.json","paper":"/paper/2509.10031"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-04T18:20:02.004092Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.004092Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:abf1e1566762501977164e7bbb565334eee8307df073f6705df06e07be91d01c","observation_id":"109d7505-fcb0-4f70-9f06-f3381a8736ef","resolution":{"observed_at":"2026-08-04T18:20:02.004092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.093839Z","title":"Comparison of parametric representations for monosyllabic word recognition in contin- uously spoken sentences,","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.093839Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:1757f9a471246bf958ef58a0221c6fdad06ed4f7a3aaecb95533d61d03f8c761","observation_id":"48be08d9-1fb7-4f78-8529-917af10b7aca","resolution":{"observed_at":"2026-08-04T18:20:02.093839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.158499Z","title":"Gamma- tone features and feature combination for large vocabulary speech recognition,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.158499Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:03827519d52eb10675905c81618aaea5ae8a0f059b61aa8bece7d1b9528acdb7","observation_id":"f7950395-786a-4c0e-a1e0-ca042a50ee78","resolution":{"observed_at":"2026-08-04T18:20:02.158499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.273308Z","title":"Convolu- tional, long short-term memory, fully connected deep neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.273308Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:623f7be42bfc0c7d844ec699cf2603d1cb8b44ff5b9dccd94d2be6fc5bf1ea5e","observation_id":"e4fd773a-b81d-478a-899c-db430e46468b","resolution":{"observed_at":"2026-08-04T18:20:02.273308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.336165Z","title":"Learning the speech front-end with raw wave- form CLDNNs,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.336165Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:5f04d5df8df3ac1d09e9a64376c5a947041821e3521dba094a3a971e85e3d877","observation_id":"d559b726-da31-4802-b6f4-94b6c6cd3265","resolution":{"observed_at":"2026-08-04T18:20:02.336165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.395692Z","title":"Learning filterbanks from raw speech for phone recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.395692Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:0a124e9ffb7dc1f7263e8fe788d4c4700624f59b34cd6d0b6f1989d4e80db20a","observation_id":"32b051fe-d3f6-45d1-9a00-b0866c08dc5b","resolution":{"observed_at":"2026-08-04T18:20:02.395692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.480646Z","title":"Acoustic modeling of speech waveform based on multi-resolution, neural network signal processing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.480646Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:39c4f0a592ed388fba1396c25e0fc3d6d2b15094892c07c0b036081c2f152177","observation_id":"152edbf0-153f-4493-a846-e4879bd61ace","resolution":{"observed_at":"2026-08-04T18:20:02.480646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.570844Z","title":"LEAF: A learnable frontend for audio classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.570844Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:b4d8c3d7d384f237f300f2f37079eba598425ae7036a9b82e9cbade1a3d24dd0","observation_id":"ed2e966d-a370-4635-98f8-874524fa3751","resolution":{"observed_at":"2026-08-04T18:20:02.570844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.604119Z","title":"Speaker recognition from raw waveform with SincNet,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.604119Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:ca38855327496b91d113052d0fb24ece39ef18d31469e466b1e17ded8db56a72","observation_id":"84f0e200-a973-4ed1-a5f1-5b70c354cf00","resolution":{"observed_at":"2026-08-04T18:20:02.604119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.664169Z","title":"Acoustic mod- eling with deep neural networks using raw time signal for LVCSR,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.664169Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:c05c7aceeff9110895c861174148e3de267876525cdb28a73c5d43617d1fb52c","observation_id":"d8a62980-9637-4de0-aad0-3de202938d25","resolution":{"observed_at":"2026-08-04T18:20:02.664169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.751959Z","title":"Comparative analysis of the wav2vec 2.0 feature extractor,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.751959Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:57a094b60439468bc1e0fb668757e862f08ede02bd1ac9e64252c1576add2d49","observation_id":"1affca94-1e91-4aee-9c22-9c9c07cb0b69","resolution":{"observed_at":"2026-08-04T18:20:02.751959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.852765Z","title":"Perception of speech and sound,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.852765Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:6a212188d91506136459213d00ea224e7877a790587d3ce13510d121a422b41b","observation_id":"04ccb861-c785-4e2e-a52d-6873fd67a363","resolution":{"observed_at":"2026-08-04T18:20:02.852765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:02.945495Z","title":"Perceptual linear predictive (PLP) analysis of speech,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:02.945495Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:07aaac2861ac35ca46dedd3e590038ca27ea3b2d16d65eb53011b8cf58d2cd4e","observation_id":"fd158a96-6040-4ac8-a193-359a6a599c66","resolution":{"observed_at":"2026-08-04T18:20:02.945495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.009824Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.009824Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:7c31b64b4f372cdc10e87bb32e6ce471874d9d9ad067190c9ee9f9a51fe90221","observation_id":"b38217d0-6ebe-4d38-9af2-cf4c7f95da9e","resolution":{"observed_at":"2026-08-04T18:20:03.009824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.092129Z","title":"Advances in joint CTC-attention based end-to-end speech recognition with a deep CNN encoder and RNN-LM,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.092129Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:4b4bbb3cf2d4b8cd794511fd516afce170a2edc2d71462c297179213a53323df","observation_id":"65984a7a-7b30-418a-92dd-1f4361b48cf1","resolution":{"observed_at":"2026-08-04T18:20:03.092129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.172520Z","title":"Very deep convolu- tional networks for end-to-end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.172520Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:cf375bf9525c2edf9597115c95aa93d8f23fcd337cde8682e13ce2b5f8a12b2b","observation_id":"7a531257-6082-42c8-a61b-4b7232913449","resolution":{"observed_at":"2026-08-04T18:20:03.172520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.255481Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.255481Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:610e85f3f1054ff196acdb3a879725160d7292dc9cb4d85bdfd31bc3bedc9353","observation_id":"965a78e3-64e3-472c-ac99-b9146e79ea93","resolution":{"observed_at":"2026-08-04T18:20:03.255481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.332929Z","title":"wav2vec: Unsupervised pre-training for speech recogni- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.332929Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:fdd32368ff659ce29a4438cb7ccfac6ace02e55c2dce9b4c008ce3c7828cbb56","observation_id":"a63d845f-d60b-4497-80bd-df9a7933dccd","resolution":{"observed_at":"2026-08-04T18:20:03.332929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.415639Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech rep- resentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.415639Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:53b5fb9731cb666fa199b835ff843741ac58b70f7fef725a87e8fcb89305c97b","observation_id":"d9a855c8-0096-4f02-96d7-131d64e3b8fa","resolution":{"observed_at":"2026-08-04T18:20:03.415639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.495602Z","title":"On architectures and training for raw waveform feature ex- traction in ASR,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.495602Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:7de141f2393733cee84c7838275564709de341c20708f2016e5478c707baae96","observation_id":"1d8b208e-304f-4941-9435-709d9e35762d","resolution":{"observed_at":"2026-08-04T18:20:03.495602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.557499Z","title":"HuBERT: How much can a bad teacher bene- fit ASR pre-training?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.557499Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:3bc6e0c53349ee23f222c8ce05712cecd9059edcd795fe88db7098d0852fbaa7","observation_id":"cb45b9f4-71f1-486a-a227-605212e575be","resolution":{"observed_at":"2026-08-04T18:20:03.557499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.635269Z","title":"SpecAugment: A simple data aug- mentation method for automatic speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.635269Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:2116113b231f0b243e3a6a542bc4b0367a2cca2d37aadba15c134c7138e1eb7d","observation_id":"4d468084-f470-46b5-8eee-afd7be793fb0","resolution":{"observed_at":"2026-08-04T18:20:03.635269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.736813Z","title":"Regularizing learnable feature extraction for auto- matic speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.736813Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:d324cfac0dd73ebfb64510dcf1b481ce970737c9d83fdb0f97a55dafd7415d34","observation_id":"62160d4f-c8a6-4ce0-b01e-378c1e907074","resolution":{"observed_at":"2026-08-04T18:20:03.736813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T18:20:03.773906Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.773906Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:eea39ac69c864f51734b32fefe06e9390998bc3138cdc8f77d874bd9e44e6fcf","observation_id":"1730b50e-d520-4c9f-ad35-ba72024e14fd","resolution":{"observed_at":"2026-08-04T18:20:03.773906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-04T18:20:03.847948Z","title":"Gaussian error linear units (GELUs),","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.847948Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:1b9e5329f48d69ef1b6a6004c553766b1294e13be3876d05cbd55449aad9fbfd","observation_id":"9aaa4fa4-7b50-41a4-922b-227e6120239d","resolution":{"observed_at":"2026-08-04T18:20:03.847948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:03.926948Z","title":"Efficient training of neural transducer for speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:03.926948Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:6dda12131126e32ca8f451a95954c1a28d70b42b1d2cdaef8ac13915facd2255","observation_id":"9ea69aff-4f94-4b2f-90ee-430ea6c1dc80","resolution":{"observed_at":"2026-08-04T18:20:03.926948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:04.010498Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:04.010498Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:47978f86dea1e8c6e6347325ed96aa75623b12640f8c35f5f94c656de2c16132","observation_id":"fd6b6f05-9b20-41ab-9ce4-7b60e3ae3efe","resolution":{"observed_at":"2026-08-04T18:20:04.010498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:04.088644Z","title":"Joint-sequence models for grapheme- to-phoneme conversion,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:04.088644Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:e3752fe411b4410a27bd77919a8f8487ec5be83376fe1dce8d9501af6af71f59","observation_id":"83f12331-f177-4233-88a5-a541a6a2ce43","resolution":{"observed_at":"2026-08-04T18:20:04.088644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:04.146514Z","title":"Self-attention with relative position representations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:04.146514Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:a3dac1402ede00e11c5a190721d044c4fd652502f1f29ebcd4f0be1e973c1b04","observation_id":"b8eae0d9-983d-43d9-ad73-3c0d9fc7b024","resolution":{"observed_at":"2026-08-04T18:20:04.146514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:04.228552Z","title":"Decoupled weight decay regu- larization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:04.228552Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:60edf255c0d0a90e5b644f7dce56fe137587d33d2ce24c3781a1230b04dfb7b1","observation_id":"b195cab1-6a15-4cdc-a7fc-272b20d3fb23","resolution":{"observed_at":"2026-08-04T18:20:04.228552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:04.312647Z","title":"Flashlight: Enabling innovation in tools for machine learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:04.312647Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:cc2ced9b1ada288eba267c0d77786def878a6dbcdb6085087bc19b0b9bfba423","observation_id":"82198bf8-362d-4f25-96d0-0f0598006830","resolution":{"observed_at":"2026-08-04T18:20:04.312647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:20:04.427870Z","title":"An efficient auditory filterbank based on the gamma- tone function,","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:20:04.427870Z"},"links":{"citing_paper":"/paper/2509.10031"},"observation_digest":"sha256:2489d859f0d4a23af6547967acf91e537a94ba6c0ca1303941d2749d424c8324","observation_id":"f0e7b3a7-c95b-4a88-b65b-6f8c881cb1c4","resolution":{"observed_at":"2026-08-04T18:20:04.427870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10031","last_updated":"2025-09-12T07:52:51Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T13:30:47.553688Z","submitted_at":"2025-09-12T07:52:51Z","title":"Unified Learnable 2D Convolutional Feature Extraction for ASR"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2509.10031."}