{"as_of":"2026-08-09T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0463d6c0ff1bdb22aae0c1dc81d57266f2962b41fb029a6cdcd611be32012081","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:19:03.988835Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24820/citation-record","integrity":"/paper/2505.24820/integrity","json":"/paper/2505.24820/citation-record.json","paper":"/paper/2505.24820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:10.606057Z","title":"Small-footprint keyword spotting using deep neural networks,","venue":null,"work_id":"d2717cd1-6439-432f-9868-eabfd286cf84","year":null},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.619891Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:51da30a28b28df0d0e4465cf2e87f1bc6aeb25d15223278991578ed81a778622","observation_id":"40a7845b-64aa-4b1a-8603-a10eba5bbd0e","resolution":{"observed_at":"2026-08-07T12:19:10.692811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:00.707955Z","title":"Multi-task learning and weighted cross-entropy for dnn-based keyword spotting,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.707955Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:7b8ebf739659e788eb20e4c7ded1544849a3ad29eff74ed1d840af40643cf63a","observation_id":"576125be-7efa-4db4-8869-dd5b0e5df1eb","resolution":{"observed_at":"2026-08-07T12:19:00.707955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:10.256857Z","title":"Compressed time delay neural network for small-footprint keyword spotting,","venue":null,"work_id":"ced947d4-5845-4063-a2ac-83fede9f99f3","year":2017},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.797083Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:e37f30ccd3c98303e585d9d509552c77d662f51c9eff6da2a6914e86c321208e","observation_id":"b7dad51d-c728-4538-a5ee-825625d8bf66","resolution":{"observed_at":"2026-08-07T12:19:10.441790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.947388Z","title":"Text adaptive detection for customizable keyword spotting,","venue":null,"work_id":"49a5e8e3-26e0-47f0-bacb-5660ebf86cad","year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.882708Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:87a0c55a3df003666dd2fda3a75b52b0ad6993dc87cf5f7f074e0158f795994c","observation_id":"6cb99265-851e-41f4-a5a0-83fbd8d41d1a","resolution":{"observed_at":"2026-08-07T12:19:10.092117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.705093Z","title":"Text-aware speech separation for multi-talker keyword spotting,","venue":null,"work_id":"7dc35a2d-406d-4868-8b16-60de1ca77e33","year":2024},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:00.999348Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:297a133321dfe8cc2b23defbe78a1779755261efd59b7cb28cc3a00f37569f4f","observation_id":"74d6320e-f709-4ca0-9c40-b91baf56ed54","resolution":{"observed_at":"2026-08-07T12:19:09.790094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19577","last_updated":"2025-06-30T16:21:25Z","snapshot_observed_at":"2026-08-09T20:54:35.031562Z","submitted_at":"2025-05-26T06:47:43Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","version":3},"cited_work":{"arxiv_id":"2505.19577","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19577","snapshot_observed_at":"2026-08-07T12:19:04.401514Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","venue":"eess.AS","work_id":"87eba257-50ac-43e6-8102-a857591930f8","year":2025},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.129873Z"},"links":{"cited_paper":"/paper/2505.19577","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:49e5dfb67133c070663e3a407716bbd58ea31792fdea49b3702431db9a45debd","observation_id":"569e28d9-7201-4607-8b5b-f007d3cf46b8","resolution":{"observed_at":"2026-08-07T12:19:04.474772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.456940Z","title":"Self-attention transducers for end-to-end speech recognition,","venue":null,"work_id":"f093b47d-1049-4ce3-ad32-4213adb37666","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.225778Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:670f045e95408fd0f008c077265ded2fb0370a1344eeab6ad99a02a17e298848","observation_id":"7a5d9b57-681b-4a6e-a3a3-279362e9252e","resolution":{"observed_at":"2026-08-07T12:19:09.609371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12977","last_updated":"2019-10-28T21:29:21Z","snapshot_observed_at":"2026-08-07T03:57:12.028834Z","submitted_at":"2019-10-28T21:29:21Z","title":"Transformer-Transducer: End-to-End Speech Recognition with Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12977","snapshot_observed_at":"2026-08-07T12:19:01.332106Z","title":"Transformer-transducer: End-to-end speech recognition with self-attention,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.332106Z"},"links":{"cited_paper":"/paper/1910.12977","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:4c11c371f5561df68ac5a303af992626a6f600b678a2e4f51cc0cdd9ba781b01","observation_id":"9fa23c3d-4ec9-4e85-9680-74cd8537d232","resolution":{"observed_at":"2026-08-07T12:19:01.332106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.240045Z","title":"Transformer transducer: A streamable speech recognition model with transformer encoders and rnn-t loss,","venue":null,"work_id":"1069a0e3-0a9d-4960-9c6d-8e777d2caeb2","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.416405Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:3d9f97129de22c659653d082b33cb3d34974b079adcea380bd607f35424f9cf3","observation_id":"d836ed7d-4221-4fda-804e-49be7a1750a3","resolution":{"observed_at":"2026-08-07T12:19:09.323308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:09.044235Z","title":"ContextNet: Improving Convolutional Neural Networks for Automatic Speech Recognition with Global Context,","venue":null,"work_id":"d61cffe0-4233-4074-8627-fcb25f93fdbf","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.525372Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:ccfd0812da4c2c7d9af164177ef7034b14747aa8fee39477b5e326bc6acba4f1","observation_id":"f93c5290-5484-4848-bfae-31d685209850","resolution":{"observed_at":"2026-08-07T12:19:09.130396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:01.631171Z","title":"Conformer: Convolution- augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.631171Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:b7595e9419a336bc4ac16f6a22db7a2b2325db486c7a07f1b80687e943480333","observation_id":"4938cc31-fd36-4efe-a45b-5bfc1739ea9c","resolution":{"observed_at":"2026-08-07T12:19:01.631171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05352","last_updated":"2022-07-01T20:41:39Z","snapshot_observed_at":"2026-08-09T07:22:54.903835Z","submitted_at":"2022-04-11T18:18:53Z","title":"Large-Scale Streaming End-to-End Speech Translation with Neural Transducers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05352","snapshot_observed_at":"2026-08-07T12:19:01.722172Z","title":"Large-scale streaming end-to-end speech translation with neural transducers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.722172Z"},"links":{"cited_paper":"/paper/2204.05352","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:148ef8a3d6a8500225a5155208b53451c049d1d1d7b0062b3d149a5b7819b0c1","observation_id":"6f932803-aaed-4d1d-9318-ec47fabbddc3","resolution":{"observed_at":"2026-08-07T12:19:01.722172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14321","last_updated":"2025-03-14T00:10:58Z","snapshot_observed_at":"2026-08-09T13:51:45.924769Z","submitted_at":"2024-01-25T17:19:01Z","title":"VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14321","snapshot_observed_at":"2026-08-07T12:19:01.847943Z","title":"V ALL-T: decoder-only generative transducer for robust and decoding-controllable text-to-speech,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.847943Z"},"links":{"cited_paper":"/paper/2401.14321","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:8ff58be89f2d2ce43fd5da1e3ebe7dfdbbbc3f5becef1704f83c0c1e18b7e0c6","observation_id":"a3208703-8afc-40fe-955b-7e983c385967","resolution":{"observed_at":"2026-08-07T12:19:01.847943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.715148Z","title":"Streaming small-footprint keyword spotting using sequence-to- sequence models,","venue":null,"work_id":"e9830a8b-97d0-433d-bf2e-0ec5b21575c7","year":2017},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.076071Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:f94da2c1743c8e0cc100efacb83bfa03d13a3af9bfee07b72bb15c6f9cc08343","observation_id":"d2c9b7b9-8800-4463-83ba-73efb5daf17e","resolution":{"observed_at":"2026-08-07T12:19:08.897277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.462696Z","title":"Adaptation of rnn transducer with text-to-speech technology for keyword spotting,","venue":null,"work_id":"a29b6f6d-e884-4e11-a8c1-12becb9b5ab1","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.192193Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:fb1d3c40fb1820f66bc5634a8de04a56a0008db4dcb8f41fba9e610c50405922","observation_id":"955f634b-17a6-4da2-85e4-6655b6afb25e","resolution":{"observed_at":"2026-08-07T12:19:08.602495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.178730Z","title":"Improving rnn trans- ducer modeling for small-footprint keyword spotting,","venue":null,"work_id":"e57aed30-a27c-4925-83b1-c0500ddccab8","year":2021},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.287962Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:da410e47ffe8463919fe0bbaaec9e5d9e9c9839785013a72c0bb0aac775fd6d8","observation_id":"060320cd-109c-4168-a2e5-6f70ffcbbf9b","resolution":{"observed_at":"2026-08-07T12:19:08.297088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:08.026270Z","title":"Rnn-t based open-vocabulary keyword spot- ting in mandarin with multi-level detection,","venue":null,"work_id":"d4e5809f-dc91-4335-aad5-f5a9f1c3bb41","year":2021},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.373111Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:f38f29356c6bce97b0fbfae9bf5e464df05810f660637004d58766b6e9aa1c78","observation_id":"a7e195fb-519f-47fa-a25d-afad723fd7fc","resolution":{"observed_at":"2026-08-07T12:19:08.105424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.964943Z","title":"CaTT- KWS: A multi-stage customized keyword spotting framework based on cascaded transducer-transformer,","venue":null,"work_id":"db7c0309-9dac-427b-a2c3-3b345f321977","year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.459007Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:a528b5cba4cc289ee6b4ec2efe443ebe9d5693fc6658fc047cf924e41f0f9e03","observation_id":"38930a02-9ed7-4c52-9fdd-40418d906bd4","resolution":{"observed_at":"2026-08-07T12:19:07.575606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.718772Z","title":"TDT-KWS: fast and accurate keyword spotting using token-and-duration transducer,","venue":null,"work_id":"dea86fde-173d-4d1c-9821-84c7d598c617","year":2024},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.556456Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:819d4bf48a20bc59a45d3f10efb8b675c8a4fc735b712b834e9fb74ac2747e8f","observation_id":"2e30d6a4-72d5-4839-a6a7-e55a806f1d32","resolution":{"observed_at":"2026-08-07T12:19:06.854939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.546603Z","title":"U2-KWS: unified two-pass open-vocabulary keyword spotting with keyword bias,","venue":null,"work_id":"0172dc73-2769-4b38-82a7-bb08cc27a3ea","year":2023},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.622523Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:08100e9ed9d55848017d60c064151547ce3e4ef9a6e1d0ac87f4b289a18ce31a","observation_id":"defb9deb-c112-421c-aa3e-54ec040b6b8f","resolution":{"observed_at":"2026-08-07T12:19:06.617608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.392613Z","title":"Three-in-one: Fast and accurate transducer for hybrid-autoregressive speech recognition,","venue":null,"work_id":"c2f51219-53dc-4afe-82f5-8a9318a336d7","year":2025},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.719287Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:1500c65ef63e7f882b7d4ac16d891b540c4c8750559e512a7a284e873226098d","observation_id":"cb096fb0-db40-4cec-b377-dbaba7eb3fdb","resolution":{"observed_at":"2026-08-07T12:19:06.464267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.246458Z","title":"Nemo: a toolkit for building ai applications using neural modules,","venue":null,"work_id":"24c7d62a-26bb-45df-ae77-1015b042fa83","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.815351Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:726c52c45ed13f4d99384586bfc45032b4c88e16fac4bdfefab41716528cef06","observation_id":"d6220edf-908f-49eb-a7c8-8f8545d4d96b","resolution":{"observed_at":"2026-08-07T12:19:06.315753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:06.056460Z","title":"Pruned rnn-t for fast, memory-efficient asr training,","venue":null,"work_id":"ec6c7d63-35f9-4241-92bb-b62b27b99aa6","year":2022},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:02.915688Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:e0a117a6c569192b0fce998a1f2fa5998cc5dd3b3caeb9235357d63523b0dc2c","observation_id":"ab6c263f-ff78-493e-bd00-6c059a49176c","resolution":{"observed_at":"2026-08-07T12:19:06.168334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.853982Z","title":"Rnn- transducer with stateless prediction network,","venue":null,"work_id":"97b55b0e-49c5-465b-9311-36e6c020f432","year":2020},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.004964Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:1584f709afb693d5a22da9e389eab3d1c3b92629dc68b9cb813f161f80a09d62","observation_id":"a44eee6d-54a9-438d-a620-b1a68439ebc5","resolution":{"observed_at":"2026-08-07T12:19:05.948443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.690999Z","title":"Dropout: A simple way to prevent neural networks from overfitting,","venue":null,"work_id":"5ab170c2-5dc4-4a6a-a13e-cd5093827bd7","year":1929},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.085171Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:38201ca1eb34473fb93fb25d918285a06eab49949cf8e04fcb41923f38aa4dbd","observation_id":"4624edf5-7ac1-4ac6-b6fe-47981f0307d7","resolution":{"observed_at":"2026-08-07T12:19:05.757700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.520619Z","title":"Efficient keyword spotting using dilated convolutions and gating,","venue":null,"work_id":"bb7f0798-d2b0-48b4-9ae4-eff4c731bd51","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.173361Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:ebdfe26c831f93979cd88c627a0676a06d83b21282b48a173351ad36308bc97a","observation_id":"187f803c-8eb2-41c8-87f9-77179beee825","resolution":{"observed_at":"2026-08-07T12:19:05.589153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.340111Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"1f78be31-6b62-4d20-bc81-f181a9c89b8c","year":2015},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.285607Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:f4c3455e121473206441dd1f451e458735b7ae0f1cc45b6984f77579161fd003","observation_id":"3e645d75-6a41-4a33-ab57-f553db2abeca","resolution":{"observed_at":"2026-08-07T12:19:05.420708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-08T09:58:28.265461Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-07T12:19:03.404914Z","title":"AISHELL-2: transforming mandarin ASR research into industrial scale,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.404914Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:33fcea1fa99db3f057b2c584307e4f18920b0fd26d78a3c339b0de40f7f97363","observation_id":"e675afcc-afbe-408b-a6e4-59047e63509b","resolution":{"observed_at":"2026-08-07T12:19:03.404914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:03.502345Z","title":"Region proposal network based small-footprint keyword spotting,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.502345Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:26b14e21989a1b5c26676601b293a2b0a54d66201c632550d3443c9893df0ac3","observation_id":"19c52e71-435d-48de-9b53-4f838db885d1","resolution":{"observed_at":"2026-08-07T12:19:03.502345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:05.139610Z","title":"Audio augmentation for speech recognition","venue":null,"work_id":"a970cb1c-f827-4616-83f0-9ac64e0144b4","year":2015},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.581444Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:7e6c577bff5ff519a99a2ecb1ea4b164c81e2f608399f41c0aeb52ed19de348e","observation_id":"baabb938-3dd2-4f70-b9b3-c8b61b396bb1","resolution":{"observed_at":"2026-08-07T12:19:05.230564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:04.955217Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"db111c32-692d-43ce-b158-659fe8dae771","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.646259Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:5006c1441b29a650c82b01bada0d92bf2369c7c0be631775472d273978b726cc","observation_id":"cdf56a29-64bf-4c38-9954-4a91d4efdc48","resolution":{"observed_at":"2026-08-07T12:19:05.040391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:04.750723Z","title":"Deep-FSMN for large vocabulary continuous speech recognition,","venue":null,"work_id":"4e307166-1b15-4f11-95a5-240a9dfc6667","year":2018},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.741120Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:0bf744311f19679de797f605999e8104250a410809ccbd3f246638b1ecc17ad2","observation_id":"3843eb05-36e4-4313-9353-b6e23fd01e7a","resolution":{"observed_at":"2026-08-07T12:19:04.830444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09364","last_updated":"2020-06-24T00:57:25Z","snapshot_observed_at":"2026-07-06T07:16:33.611269Z","submitted_at":"2018-11-23T05:24:15Z","title":"Learning pronunciation from a foreign language in speech synthesis networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.09364","snapshot_observed_at":"2026-08-07T12:19:03.795856Z","title":"Learning pronunciation from a foreign language in speech synthesis networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.795856Z"},"links":{"cited_paper":"/paper/1811.09364","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:d2bb6efd1cf22cccbc88630c07e371c60332d8ac6d300b74adbda4beb944bd59","observation_id":"5ec8b2d6-15be-4c00-a479-6c3fedea4a7d","resolution":{"observed_at":"2026-08-07T12:19:03.795856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:03.881735Z","title":"Adam: A method for stochastic optimiza- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.881735Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:8fabdc5bf986b0afda4547edc530211f3a586a1b9b3a95fbd8694c51ae629998","observation_id":"0b49f958-28fc-4bec-9af8-3c9127c18d55","resolution":{"observed_at":"2026-08-07T12:19:03.881735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:19:04.575034Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"f53aaa81-4ba9-475d-95b0-edd2f6277f65","year":2019},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:03.988835Z"},"links":{"citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:92a9d7687770d0d1d025f36f0be9cb75d1aff424f3daec1f856786a70ba812c7","observation_id":"b692d8b1-6199-4619-a2b3-995820431b75","resolution":{"observed_at":"2026-08-07T12:19:04.653221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14321","last_updated":"2025-03-14T00:10:58Z","snapshot_observed_at":"2026-08-09T13:51:45.924769Z","submitted_at":"2024-01-25T17:19:01Z","title":"VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14321","snapshot_observed_at":"2026-08-07T12:19:01.968041Z","title":"Available: https://doi.org/10.48550/arXiv.2401.14321","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:01.968041Z"},"links":{"cited_paper":"/paper/2401.14321","citing_paper":"/paper/2505.24820"},"observation_digest":"sha256:153255e8414723c87712a8c79fdd66521fcd606838556cf94ef61a8b54c492ba","observation_id":"ba1f6b20-a679-4c40-94ab-177822983e7f","resolution":{"observed_at":"2026-08-07T12:19:01.968041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24820","last_updated":"2025-05-30T17:22:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T07:23:07.464682Z","submitted_at":"2025-05-30T17:22:39Z","title":"Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.24820."}