{"as_of":"2026-08-10T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:776177d7dde437338c67675eae914c01e67e430de7bb890a6d9f9c11749c32e8","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:02:26.521767Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:02:25.274818Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:02:27.830832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.03722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03722","snapshot_observed_at":"2026-08-07T11:02:27.830832Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","venue":"cs.CL","work_id":"8af7d16e-8e6f-4fef-af74-4b09f2b9d1cc","year":2025},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.274818Z"},"links":{"cited_paper":"/paper/2506.03722","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ce6864d57d8ce4ccdc3a6e2d1b2150165c31b7e448b6cb7c5a71dc5f45b33984","observation_id":"a6de1878-e4cb-429f-b45c-fdd1d7fc35da","resolution":{"observed_at":"2026-08-07T11:02:27.864246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03722/citation-record","integrity":"/paper/2506.03722/integrity","json":"/paper/2506.03722/citation-record.json","paper":"/paper/2506.03722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.370232Z","title":null,"venue":null,"work_id":"b23195a3-af8a-452d-8492-7ae365ab5a21","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:24.957407Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:e58dfe28cfa7ba0415ec6aceecb4c7c876f5ad219091f2eec3348fc5a492eaa9","observation_id":"3ad25024-bdbb-43bd-82ed-35bbcc743e63","resolution":{"observed_at":"2026-08-07T11:02:29.421803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.247449Z","title":null,"venue":null,"work_id":"8dcf098d-3743-4d06-b9d5-858209bdda89","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.016140Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b4c2e9712af9eb13e0d6bb57de5ac6c074550e983353eda3c86e029076b7301b","observation_id":"edf492e5-494a-4345-9e56-36093bfe0fa9","resolution":{"observed_at":"2026-08-07T11:02:29.296199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.141385Z","title":null,"venue":null,"work_id":"755fd40a-797f-4744-96f1-1deb483e6e15","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.186704Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:e1c3be32d51b2f6197b5f1f0dd030cbaeaf3a731d4c78af62e0d9f83e1c14d9b","observation_id":"61ae056b-096b-47b6-95c9-8ce87a5c861a","resolution":{"observed_at":"2026-08-07T11:02:29.175286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.03722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03722","snapshot_observed_at":"2026-08-07T11:02:27.830832Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","venue":"cs.CL","work_id":"8af7d16e-8e6f-4fef-af74-4b09f2b9d1cc","year":2025},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.274818Z"},"links":{"cited_paper":"/paper/2506.03722","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ce6864d57d8ce4ccdc3a6e2d1b2150165c31b7e448b6cb7c5a71dc5f45b33984","observation_id":"a6de1878-e4cb-429f-b45c-fdd1d7fc35da","resolution":{"observed_at":"2026-08-07T11:02:27.864246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:29.030702Z","title":"Overview As shown in Figure 1, the proposed Streaming-Whisper in- cludes three modules: encoder, decoder, and predictor","venue":null,"work_id":"8a34078f-d633-425c-8d9f-7e683b4a7e95","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.302367Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:c640462deac03b44b6ef9b47376721b5f0923f9e7809213d19f0ba57d1311cd2","observation_id":"2464d843-68a0-4792-8e0e-b9fc32595a5f","resolution":{"observed_at":"2026-08-07T11:02:29.091497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.911972Z","title":null,"venue":null,"work_id":"a336dbc4-341f-44b8-8d5f-491592849e05","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.331392Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ef6afaa1ebae48b31a7575aff7d31f7df2aaf443dbb593a5722bd4b2939631b5","observation_id":"9e1d1057-e552-497e-8374-3e778eeef719","resolution":{"observed_at":"2026-08-07T11:02:28.959072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.796398Z","title":"Architecture Experiment We implement the Streaming-Whisper framework in various scale architectures, including Small, Medium, Large-V3 and Large-V3-Turbo","venue":null,"work_id":"ab30d147-d23d-40aa-a469-1b46c1bbcee3","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.401724Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:0db5acd5cf04011b048d172a7d10ce7e7829c9649cd1140f323a37f50c9cc6fb","observation_id":"36560324-ac82-4966-9575-8ad40b073c37","resolution":{"observed_at":"2026-08-07T11:02:28.849332Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.665369Z","title":null,"venue":null,"work_id":"9e119c6e-ee66-4dbd-a08a-7c7e0bbed441","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.460049Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:f805606cecdefe61b116561a72309881801dce22a7204a04b8a3f907697dc25d","observation_id":"0f1c753b-bfc5-4811-8aa3-8298fcdd8147","resolution":{"observed_at":"2026-08-07T11:02:28.711144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.523465Z","title":null,"venue":null,"work_id":"389352bb-fe8f-4bfa-9923-8c0586ee55af","year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.493698Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:bfff5eb8b089544fae2475c66c62eff758a9514bd180829edd5e2dee05f17b77","observation_id":"8f2b1eb9-1a1b-477d-84a5-7b4af285083e","resolution":{"observed_at":"2026-08-07T11:02:28.553468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:25.532368Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.532368Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b50cd91220df65ac106be738ce5406427cb6ad93b2f523608e26f9f00543c35c","observation_id":"e20beac4-c443-4c82-9811-b6d998476be6","resolution":{"observed_at":"2026-08-07T11:02:25.532368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-08T04:51:03.844048Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-07T11:02:25.579863Z","title":"Distil-whisper: Robust knowledge distillation via large-scale pseudo labelling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.579863Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:0c18e43a7f8adbfde3a937db4b3a21ac308a57181c32845802baea6bfad9b86c","observation_id":"1f94fa03-a836-493d-946c-a242bb931773","resolution":{"observed_at":"2026-08-07T11:02:25.579863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10788","last_updated":"2024-09-29T05:28:40Z","snapshot_observed_at":"2026-07-06T15:29:05.031168Z","submitted_at":"2023-05-18T08:00:09Z","title":"DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition","version":2},"cited_work":{"arxiv_id":"2305.10788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10788","snapshot_observed_at":"2026-08-07T11:02:27.709724Z","title":"DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition","venue":"cs.SD","work_id":"e12d283f-1960-495f-9b79-8a3050142849","year":2023},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.617059Z"},"links":{"cited_paper":"/paper/2305.10788","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ca8ce0c3ec4be8edca828820fd054b857641ca48f09b799c54d2882e9b67850a","observation_id":"312b581e-6c95-4a2e-a0e8-28fa60791870","resolution":{"observed_at":"2026-08-07T11:02:27.733126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15869","last_updated":"2024-09-24T08:42:31Z","snapshot_observed_at":"2026-07-06T19:21:03.775247Z","submitted_at":"2024-09-24T08:42:31Z","title":"Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15869","snapshot_observed_at":"2026-08-07T11:02:25.664456Z","title":"Whisper in medusa’s ear: Multi-head efficient decod- ing for transformer-based asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.664456Z"},"links":{"cited_paper":"/paper/2409.15869","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:088073c608f87c64dda7801579c3fcd9cbeae684b81ef87f9fb8c9547b575b3d","observation_id":"1d49c508-9bb1-4082-be68-bd869d01d3a7","resolution":{"observed_at":"2026-08-07T11:02:25.664456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.413793Z","title":"Synchronous transformers for end-to-end speech recognition,","venue":null,"work_id":"7dcd0de1-b73e-4aae-be69-437b04f6c882","year":2020},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.698313Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:8e5868c7156f16dab3a136a680892ee17fc691e4b58632fe5f2d9a5e23144fc3","observation_id":"af8b09fb-4e69-423c-85e3-794b6b15300c","resolution":{"observed_at":"2026-08-07T11:02:28.459357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.225250Z","title":"Online and linear-time attention by enforcing monotonic alignments,","venue":null,"work_id":"7a25f29b-80d0-4204-8809-8e2e4d0dcf0a","year":2017},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.737286Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:7ec2cc1ff796e94b23a6ec9e915d97b10003e303bbe1fcbdc46cc2eeb5436364","observation_id":"135afe41-8a09-49b1-989e-ed5a59da3c2f","resolution":{"observed_at":"2026-08-07T11:02:28.329494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05218","last_updated":"2019-06-12T15:49:31Z","snapshot_observed_at":"2026-08-07T23:49:03.922415Z","submitted_at":"2019-06-12T15:49:31Z","title":"Monotonic Infinite Lookback Attention for Simultaneous Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05218","snapshot_observed_at":"2026-08-07T11:02:25.795500Z","title":"Monotonic infinite lookback attention for simultaneous machine translation,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.795500Z"},"links":{"cited_paper":"/paper/1906.05218","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ab7bacfa5b87b2f8db118c037bf719677104cee878864b7e7e394adbd6e6292d","observation_id":"a0acb00d-930b-481c-b734-57ea66cbbfa7","resolution":{"observed_at":"2026-08-07T11:02:25.795500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05382","last_updated":"2018-02-23T01:35:36Z","snapshot_observed_at":"2026-08-09T00:00:42.100207Z","submitted_at":"2017-12-14T18:29:42Z","title":"Monotonic Chunkwise Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05382","snapshot_observed_at":"2026-08-07T11:02:25.841709Z","title":"Monotonic chunkwise attention,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.841709Z"},"links":{"cited_paper":"/paper/1712.05382","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b6e952f04a151e425ecfa66ce8c2599ac605f161248a2dde2c3be79bc65b3005","observation_id":"90548500-351e-441d-ae65-0c34ae69fbe0","resolution":{"observed_at":"2026-08-07T11:02:25.841709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12406","last_updated":"2019-09-26T21:32:50Z","snapshot_observed_at":"2026-08-01T11:32:02.592655Z","submitted_at":"2019-09-26T21:32:50Z","title":"Monotonic Multihead Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12406","snapshot_observed_at":"2026-08-07T11:02:25.867881Z","title":"Monotonic multi- head attention,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.867881Z"},"links":{"cited_paper":"/paper/1909.12406","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b398c5c6f92dc93aa54861fde2f608a663a3be401b19f652db406d1957e8da0f","observation_id":"32b3e10e-9080-475b-96d3-17e399fb5dc0","resolution":{"observed_at":"2026-08-07T11:02:25.867881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08398","last_updated":"2019-06-24T21:35:07Z","snapshot_observed_at":"2026-08-03T06:11:18.979670Z","submitted_at":"2018-10-19T08:37:40Z","title":"STACL: Simultaneous Translation with Implicit Anticipation and Controllable Latency using Prefix-to-Prefix Framework","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08398","snapshot_observed_at":"2026-08-07T11:02:25.916569Z","title":"Stacl: Simultaneous trans- lation with implicit anticipation and controllable latency using prefix-to-prefix framework,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.916569Z"},"links":{"cited_paper":"/paper/1810.08398","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:46df93cfbf28d384ed016cc6955696077001734fd9c9f724c96d4630b8898eaf","observation_id":"441c5d90-9e07-4f27-b643-328065858d35","resolution":{"observed_at":"2026-08-07T11:02:25.916569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11185","last_updated":"2020-10-13T16:18:44Z","snapshot_observed_at":"2026-08-07T01:29:37.417292Z","submitted_at":"2020-05-22T13:42:54Z","title":"Low-Latency Sequence-to-Sequence Speech Recognition and Translation by Partial Hypothesis Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11185","snapshot_observed_at":"2026-08-07T11:02:25.953199Z","title":"Low-latency sequence-to- sequence speech recognition and translation by partial hypothesis selection,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:25.953199Z"},"links":{"cited_paper":"/paper/2005.11185","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:6ce1fb3c853d501229b1dbaee937620c091911d7778f81b96afd4a584129dd2a","observation_id":"5aeed60a-53f0-4029-a595-107f8d9e2502","resolution":{"observed_at":"2026-08-07T11:02:25.953199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10052","last_updated":"2024-06-14T14:07:26Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:07:26Z","title":"Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10052","snapshot_observed_at":"2026-08-07T11:02:26.001831Z","title":"Simul-whisper: Attention-guided streaming whisper with truncation detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.001831Z"},"links":{"cited_paper":"/paper/2406.10052","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:2eaa71eb13caea2fffd0521be27c5dbc9a49d9058fbf51aaec9f145d753f58bc","observation_id":"03e6669f-85eb-459d-8a15-84f1d2cc1996","resolution":{"observed_at":"2026-08-07T11:02:26.001831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09491","last_updated":"2024-08-18T14:10:35Z","snapshot_observed_at":"2026-08-09T14:30:33.963807Z","submitted_at":"2024-08-18T14:10:35Z","title":"A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition","version":1},"cited_work":{"arxiv_id":"2408.09491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09491","snapshot_observed_at":"2026-08-07T11:02:27.202607Z","title":"A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition","venue":"cs.SD","work_id":"040950a7-6203-4c65-a0fc-203de44205a1","year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.042426Z"},"links":{"cited_paper":"/paper/2408.09491","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:524a63feccdeb825f077d5f35d252947632a57fe2cb8f7524e4c68481fe6d595","observation_id":"56031542-b6dc-4e09-ba41-3d151e88fbc5","resolution":{"observed_at":"2026-08-07T11:02:27.233281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.120379Z","title":"Cif: Continuous integrate-and-fire for end- to-end speech recognition,","venue":null,"work_id":"2875dc0c-34d2-491e-bbe5-7a3019edfdec","year":2020},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.071756Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:a1ba1a3aa478c7082fa378b80fb16fd53c01ba4aacff665299dbb0c618244215","observation_id":"a55a72e4-ac9a-4ea7-831d-3ae2ff1b739b","resolution":{"observed_at":"2026-08-07T11:02:28.159036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T11:02:26.108415Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.108415Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:1acaea930b5300a3b3124f68ab2f9166cf703f48610d47f85958b186ec0eea75","observation_id":"d174e39a-ca50-44cc-a430-4fe19c142abe","resolution":{"observed_at":"2026-08-07T11:02:26.108415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-07T11:02:26.135591Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model bench- mark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.135591Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:a457b19974796852268ee266e70f84b1b2e66880dc60b25dcdf6a68e2482f237","observation_id":"67f74920-be81-43fe-a871-d1ab29ffa4bb","resolution":{"observed_at":"2026-08-07T11:02:26.135591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:26.161343Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.161343Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ab665466284e365514169b7a99301107cb288619197de83fb695a6133f945cc4","observation_id":"ce4e93f9-b54e-4734-8df5-1880d97d57f9","resolution":{"observed_at":"2026-08-07T11:02:26.161343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T11:02:26.185556Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.185556Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ec1198bc23a733a96f8131ae6bb779fbfe8e1a8a569d260b3d7141a0b848b052","observation_id":"f1ee1185-2fb3-4b55-9f28-3f85c216c1a9","resolution":{"observed_at":"2026-08-07T11:02:26.185556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-09T19:09:23.880235Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T11:02:26.212501Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.212501Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:308ba4d6e4394b7fe0f2c686b884aee9442570552f49b59bfb13085630f83182","observation_id":"62cf6209-dec3-431b-98bc-12855fdd7f48","resolution":{"observed_at":"2026-08-07T11:02:26.212501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:02:26.265204Z","title":"Lora: Low-rank adaptation of large lan- guage models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.265204Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:1c4c45dc415d8d8450d624c0541ee06226514b087cf13f09df5c6269eb5b9e19","observation_id":"13fd02b6-7e6a-474d-8970-69b72b8e7c2a","resolution":{"observed_at":"2026-08-07T11:02:26.265204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:28.002362Z","title":"Wenet: Production oriented stream- ing and non-streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"dffee610-f89e-47f8-81c7-28533b9bdbf8","year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.298875Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:136ce23c3e59d00f28f664dcfcf3503a6146164f46b047f1d6127608f05986a1","observation_id":"4b14c21e-f6a4-4fc6-b5e8-e07eed1ce21e","resolution":{"observed_at":"2026-08-07T11:02:28.028125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:27.923827Z","title":"A normalized levenshtein distance metric,","venue":null,"work_id":"99fd7395-bcf0-4a82-8a0b-cbb93af16559","year":2007},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.344072Z"},"links":{"citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:9765e759d0b0bc114a50b5682ba27fe8fab05d4b4b7981ccdbd6d605d8f1c12c","observation_id":"bb5a1031-7848-458a-a6eb-8e37522a294d","resolution":{"observed_at":"2026-08-07T11:02:27.953531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00048","last_updated":"2019-05-31T19:57:49Z","snapshot_observed_at":"2026-07-06T07:57:07.607538Z","submitted_at":"2019-05-31T19:57:49Z","title":"Thinking Slow about Latency Evaluation for Simultaneous Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00048","snapshot_observed_at":"2026-08-07T11:02:26.381434Z","title":"Thinking slow about latency eval- uation for simultaneous machine translation,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.381434Z"},"links":{"cited_paper":"/paper/1906.00048","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:84028c9175ca3fec7fd3d0b1694b385829ceab22755ade6ad2937c87e669000f","observation_id":"b49141ee-4631-461b-80c3-27bddc050b50","resolution":{"observed_at":"2026-08-07T11:02:26.381434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19954","last_updated":"2024-06-28T14:40:03Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T14:40:03Z","title":"BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19954","snapshot_observed_at":"2026-08-07T11:02:26.413735Z","title":"Bestow: Efficient and streamable speech language model with the best of two worlds in gpt and t5,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.413735Z"},"links":{"cited_paper":"/paper/2406.19954","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:a8ae4a6dc947c7731af0ad9274c48d35331e20baabb9ab651efeea1c80dc9c9e","observation_id":"119599e9-2be7-47cb-9a49-5b9e0dc40092","resolution":{"observed_at":"2026-08-07T11:02:26.413735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:02:26.464939Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.464939Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:376106eb889ff7267373fcda5444b170596ae46257aea0b730836f96b0ddea12","observation_id":"f17c0303-5cf2-49dc-a0c5-46f3466b5844","resolution":{"observed_at":"2026-08-07T11:02:26.464939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03752","last_updated":"2024-10-02T01:54:35Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-02T01:54:35Z","title":"Efficient Streaming LLM for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03752","snapshot_observed_at":"2026-08-07T11:02:26.495635Z","title":"Efficient streaming llm for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.495635Z"},"links":{"cited_paper":"/paper/2410.03752","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:2db07360687994007d90c2752a814eff64b25a5775c48c86916df358e03ba817","observation_id":"1ee4d6ae-089e-4410-80bd-e67f089d5773","resolution":{"observed_at":"2026-08-07T11:02:26.495635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16107","last_updated":"2024-08-01T13:55:54Z","snapshot_observed_at":"2026-07-31T19:14:30.338485Z","submitted_at":"2024-06-23T13:50:08Z","title":"Decoder-only Architecture for Streaming End-to-end Speech Recognition","version":2},"cited_work":{"arxiv_id":"2406.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16107","snapshot_observed_at":"2026-08-07T11:02:26.631012Z","title":"Decoder-only Architecture for Streaming End-to-end Speech Recognition","venue":"eess.AS","work_id":"e781efc4-2a9f-4d70-be03-06791f2c01b7","year":2024},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.521767Z"},"links":{"cited_paper":"/paper/2406.16107","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:49e11986a49dc2a1d97d80217b02148711c3e1b89e51e3ec1f7eb964936d1b38","observation_id":"a85ce056-a4a0-4df2-adae-bceb707f7f9b","resolution":{"observed_at":"2026-08-07T11:02:26.674736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T18:24:18.574411Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":6},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.03722."}