{"as_of":"2026-08-10T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af0f694319487fcc9b1ab986aeba782284fb9ccf52820b3efb66843fcc47ef0e","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:21.174309Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:17.177212Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:12:21.729943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"cited_work":{"arxiv_id":"2506.00338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00338","snapshot_observed_at":"2026-08-07T12:12:21.729943Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","venue":"cs.CL","work_id":"7b458030-ade0-40b8-8281-23179f76db02","year":2025},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.177212Z"},"links":{"cited_paper":"/paper/2506.00338","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:21cd89f48438053b72cdc8c3e2ee824fe0553fe95d987503f78471720eb054fe","observation_id":"da98eed8-8609-4fd1-87f4-9a9d2c0507e2","resolution":{"observed_at":"2026-08-07T12:12:21.828937Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00338/citation-record","integrity":"/paper/2506.00338/integrity","json":"/paper/2506.00338/citation-record.json","paper":"/paper/2506.00338"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"cited_work":{"arxiv_id":"2506.00338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00338","snapshot_observed_at":"2026-08-07T12:12:21.729943Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","venue":"cs.CL","work_id":"7b458030-ade0-40b8-8281-23179f76db02","year":2025},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.177212Z"},"links":{"cited_paper":"/paper/2506.00338","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:21cd89f48438053b72cdc8c3e2ee824fe0553fe95d987503f78471720eb054fe","observation_id":"da98eed8-8609-4fd1-87f4-9a9d2c0507e2","resolution":{"observed_at":"2026-08-07T12:12:21.828937Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:27.419851Z","title":"YODAS data cleaning The raw YODAS data has not undergone a rigorous cleaning process and may contain annotation errors [24]","venue":null,"work_id":"9296684e-9d9b-455f-9d0a-b5b51238cc44","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.271724Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:14ac26d8b30f0894c634ba04d543ed283187e7b60b3b4af98a6be0704b31ceae","observation_id":"8fecf34e-4ab5-4486-8dbe-b28d4b53b12e","resolution":{"observed_at":"2026-08-07T12:12:27.493239Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3007.8815","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:21.540818Z","title":"transcription","venue":null,"work_id":"6f971db9-df7f-4a39-a9ec-c6c7fa965c5d","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.393419Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:ff1ae9e674348cda6c3ef963ee0f9f0715cbfe307a0a8fe4e3a31e989b62b926","observation_id":"62ffcb80-8de8-42e8-be83-0757cdfc274f","resolution":{"observed_at":"2026-08-07T12:12:21.617665Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:27.236662Z","title":"We reveal that large-scale web-crawled data contains incorrect lan- guage labels and audio-text misalignments","venue":null,"work_id":"adc7493f-b6fd-46cd-915e-c683b777e199","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.504498Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:1200e30991e94846bb59d4b85819062f847eedad526976e7ac3c366e91371690","observation_id":"e9ce723c-d9be-4b7c-b87b-6e61c7bcaf36","resolution":{"observed_at":"2026-08-07T12:12:27.321548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:27.044058Z","title":null,"venue":null,"work_id":"5e846176-175e-43d9-be83-f9ccbb421752","year":null},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.586769Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:8380b1e7802eeb32f3b1b5e3f819321b6ad6649537342f2b90f81a9cc74a7236","observation_id":"fc45377e-b74f-4575-826c-4b2c2bab28f7","resolution":{"observed_at":"2026-08-07T12:12:27.141555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.868374Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"353c3489-99f5-47db-b352-bc1069161908","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.675610Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:4db3bb8eb759934f1f1fa40e7d0ccd7638dfb30926101a90f126c4cf6c4d5e3f","observation_id":"f81a6e80-6bf0-4300-ad75-9e2560fae4d9","resolution":{"observed_at":"2026-08-07T12:12:26.954012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-10T09:30:53.884156Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T12:12:17.790407Z","title":"Google USM: Scal- ing automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.790407Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:92d5dd4dfd30f5a1618414e08b230cf04983e4230d0007227cee327082c9e6d4","observation_id":"a49829e8-8114-4c2a-b598-09edd3f5f677","resolution":{"observed_at":"2026-08-07T12:12:17.790407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.716105Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"77027966-5e36-4a41-b319-e1875a074fd6","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.904554Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:ac9445b88e76018704ba1dc1dd25e3a2293b88a2ba7fb577e64fe7df45a81c7e","observation_id":"1c293df4-4f20-4953-b75d-8f948b50f06e","resolution":{"observed_at":"2026-08-07T12:12:26.785010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.562387Z","title":"Less is more: Accurate speech recognition & translation without web- scale data,","venue":null,"work_id":"93d54711-c3fe-4456-980c-b5156fb04197","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:17.996141Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:005d37b258fa2b73de98e254763f6ef6cfccc45cfbfac34c2a43b9e339a39750","observation_id":"cfbe3c66-a058-4b60-9191-a84e9b7324c4","resolution":{"observed_at":"2026-08-07T12:12:26.633111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.443586Z","title":"Reproducing Whisper-Style Training Using an Open-Source Toolkit and Pub- licly Available Data,","venue":null,"work_id":"174592bf-5e7a-458b-a83e-0fd6e16962fe","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.091981Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:c53962d2aded48404849ec3d3250bc020fc5a39fdec2c2d955851f3fe630475d","observation_id":"538be67f-567f-4d89-9806-f9d4c5892108","resolution":{"observed_at":"2026-08-07T12:12:26.501683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.319533Z","title":"ESPnet: End- to-End Speech Processing Toolkit,","venue":null,"work_id":"75fbf752-1a2e-4524-97cf-aaa4d67f097f","year":2018},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.171426Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:e72f4b4d27484df40dd58326e2b430e239ae85d4798689400bd9ae4ea1df0e1b","observation_id":"cef51312-f6bb-4e3d-9d3e-b61f35ee3ab5","resolution":{"observed_at":"2026-08-07T12:12:26.377366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:26.123938Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":"d45cb21e-0e65-4db8-82f8-ed6905535244","year":2020},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.265022Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:bf34252fee673d9d64efd088239e63ba9973e4cff4aa4d40f5541ff243bcff8a","observation_id":"42b5f007-b1a7-4cbb-b9b5-7db73be9266f","resolution":{"observed_at":"2026-08-07T12:12:26.201127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.871781Z","title":"Branchformer: Parallel MLP-attention architectures to capture local and global context for speech recognition and understanding,","venue":null,"work_id":"d3085f5b-8e17-4146-88dc-1f54f3dc294a","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.358460Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:60ec12df696007bbfff975af32067ac8c978c22c99abb6cab2151cb624459d47","observation_id":"efcccd6c-06d7-4d53-b4eb-9218918c66d4","resolution":{"observed_at":"2026-08-07T12:12:25.994805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.675673Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":"d6f96e2b-1844-43d2-b385-12a8f4f4ba65","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.435408Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:e5481581d865762347e94f26961cefa72edab486bcfdbd6522dd83b324cc0164","observation_id":"d8abf4c3-f8bf-4c5c-b159-f1501bae89d4","resolution":{"observed_at":"2026-08-07T12:12:25.745680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.545242Z","title":"Atten- tion is all you need,","venue":null,"work_id":"9a87aef9-6257-4460-9d3b-12f00022a6c9","year":2017},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.504149Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:1caf130f75d40e573806089d49e51d784488a4a96bd4bf221043ff2eb2d1e39a","observation_id":"cb75094c-5bfc-457f-8ba9-344d1fe37679","resolution":{"observed_at":"2026-08-07T12:12:25.603809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.383118Z","title":"Squeezeformer: An efficient transformer for automatic speech recognition,","venue":null,"work_id":"70be834b-7165-4248-9f2e-c403b53c024f","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.599148Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:04507a3d2d583a265ab4b440df7caeed533132315597bf5c182eb53161b55ac2","observation_id":"9d6c92d4-8967-4486-bcf5-337b9e8732a6","resolution":{"observed_at":"2026-08-07T12:12:25.467750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.253080Z","title":"Fast conformer with linearly scalable attention for efficient speech recognition,","venue":null,"work_id":"e9a08cfb-7f75-43ca-81d5-2fda43737b7b","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.726297Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:72b2ea5126992441e3d7682ce0d649e8c953b852c103d839c16833d25091d31c","observation_id":"fc6f5a37-a3b3-41f0-8d97-7f35e083183d","resolution":{"observed_at":"2026-08-07T12:12:25.321074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:25.116533Z","title":"Sum- maryMixing: A linear-complexity alternative to self-attention for speech recognition and understanding,","venue":null,"work_id":"2e56144c-684d-4c90-8faa-aada420070a4","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.814410Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:833635e72216560fc04b23f9546044cf2937b9553a21f140bf50208d72d748e1","observation_id":"86c09436-cba7-4031-b368-fd2da1233b7f","resolution":{"observed_at":"2026-08-07T12:12:25.178642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.979449Z","title":"OWSM v3.1: Bet- ter and faster open whisper-style speech models based on E- Branchformer,","venue":null,"work_id":"6ae26c38-4026-4f4b-a056-cb72da8ac532","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.852042Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:44f687a7f205fcd12c2ab4fba9299f82a9ed9e8a01d3bde955aa7b12ebd41911","observation_id":"21568b9a-d2a0-425e-819e-d272968b80f9","resolution":{"observed_at":"2026-08-07T12:12:25.047851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.838437Z","title":"E-Branchformer: Branch- former with enhanced merging for speech recognition,","venue":null,"work_id":"2ed325a0-a720-478a-a6a8-12c191623b89","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.855538Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:16992b9c59661658f9506e942ac0d8a55bed7f3039606159a0564257072b5e3a","observation_id":"837310f8-d203-4448-84fb-80b4cf0d328f","resolution":{"observed_at":"2026-08-07T12:12:24.905555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.710657Z","title":"A Comparative Study on E-Branchformer vs Conformer in Speech Recognition, Transla- tion, and Understanding Tasks,","venue":null,"work_id":"d3de523a-8af2-45a9-83de-f216161210b6","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.888232Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:881f82212a60638124d04b4ee6300e70061550c9ca419efff08981dd5f21f2d3","observation_id":"bfcef2ea-205f-4f2c-abe1-7026a12b9920","resolution":{"observed_at":"2026-08-07T12:12:24.764470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.604100Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recognition, translation, and language identification,","venue":null,"work_id":"5c641495-b27f-4521-9c47-d1e6db46a006","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.949572Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:3a10059cbb809014d0304bf1d400af09ae7a299f841459771011d642d6388fd1","observation_id":"8ca5f411-4012-44a5-9995-68ca9fbad818","resolution":{"observed_at":"2026-08-07T12:12:24.649967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.482974Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"d4fe1f1e-edbb-4765-b310-503e55d9e8ff","year":2006},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.036480Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:090fd610661e7b7ace2f2bc665a74aabd203938f056e50b164ac384df6d604df","observation_id":"56d343c9-0199-4c6e-9ab5-09ac9178e1b8","resolution":{"observed_at":"2026-08-07T12:12:24.544340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.370976Z","title":"Unsupervised data selection via discrete speech representation for ASR,","venue":null,"work_id":"c8563f86-4f45-4b25-b468-099a25ead307","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.139139Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:c5d1e104d194649df212ac6184b2cfab7183f49e3612716c59196c543838890b","observation_id":"ea1b3402-bfe7-4ff4-b7a7-7812ed9f1bed","resolution":{"observed_at":"2026-08-07T12:12:24.424537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.225409Z","title":"Unsupervised data selec- tion for speech recognition with contrastive loss ratios,","venue":null,"work_id":"81f616af-cc33-460b-b034-19157d6b0459","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.209648Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:dbcbc02020eb598163f1b83ceafd87e2094b7834b2d284e0f2f0864de850ac38","observation_id":"d971e49d-8a2c-4745-bc46-4fcaf0b7582d","resolution":{"observed_at":"2026-08-07T12:12:24.308824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:24.076618Z","title":"Spgispeech: 5, 000 hours of transcribed financial audio for fully formatted end-to-end speech recognition,","venue":null,"work_id":"60f43e76-07e1-46ae-9c39-0eea54cdaba5","year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.301270Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:1e89b8a5d0f5d4476b55da71b83bafc64ec643775726c8eaf70a84d54dd7e38a","observation_id":"272d04d1-4869-4c60-b6c8-f692c1539935","resolution":{"observed_at":"2026-08-07T12:12:24.147242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.892233Z","title":"Gigaspeech: An evolv- ing, multi-domain ASR corpus with 10, 000 hours of transcribed audio,","venue":null,"work_id":"1f9309a7-c7b0-4756-ac68-1222277c6c74","year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.428013Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:aa18e38e3e2432b8223b66272049154aec2d8b6371322f06ea2f6feac41733f8","observation_id":"2c835fcb-4178-443b-bed0-c9e0bb01c651","resolution":{"observed_at":"2026-08-07T12:12:23.980936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T12:12:19.512688Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.512688Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:994ca39af57d071f3eaf0c87124101779d7a9e0fe61ef2e9854966fc111b906f","observation_id":"9ec2465d-b686-4696-a457-74c0a22ec0aa","resolution":{"observed_at":"2026-08-07T12:12:19.512688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.705446Z","title":"YODAS: Youtube-Oriented Dataset for Audio and Speech,","venue":null,"work_id":"18f71df7-4dfa-45ca-a93b-627a273f3c94","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.597084Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:853db296910e585ad73b376ba4b1c2495b2fe36694f440f2665288d30bce118e","observation_id":"475da79a-c3f1-4fcf-b4df-06d6e81bd146","resolution":{"observed_at":"2026-08-07T12:12:23.795234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.535179Z","title":"On the effects of het- erogeneous data sources on speech-to-text foundation models,","venue":null,"work_id":"6d696cce-be99-4b8a-871b-e92b7f53a0a4","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.703596Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:ca3574003b850a2c47d9abe0b7c034217d55aa4eceba091f80aa0c1b8cb9fc3f","observation_id":"13297370-5350-435d-8613-107046f5c0d7","resolution":{"observed_at":"2026-08-07T12:12:23.611777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-10T12:32:57.990354Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-07T12:12:19.793022Z","title":"Speechstew: Simply mix all available speech recognition data to train one large neural network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.793022Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:7571e4e9582f63a9e7082b0f3ca9131cfaf5be917776380391acfacd387b44d0","observation_id":"77bf07e5-9d02-4ed0-a257-5038fcbd6f38","resolution":{"observed_at":"2026-08-07T12:12:19.793022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.395194Z","title":"MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research,","venue":null,"work_id":"4c286215-89a1-4c2f-af32-cdf8e0d0b8da","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.884354Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:de503643f125a90e2316f57ce2f6bebc0c0541e3795a6b178c03aa4b66714190","observation_id":"4575edf5-26aa-40ee-8c78-c593b0634b56","resolution":{"observed_at":"2026-08-07T12:12:23.463609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.192230Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and context,","venue":null,"work_id":"a0dfa879-6b11-4b4b-84e1-ad9a7af07625","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:19.960379Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:b383a9779bb2a533e0fc66e88127fffd3c5ab0e58c7c8302f2dd52d26609d926","observation_id":"c8bfbcdb-e401-4f64-8bbb-f01fba88ba5a","resolution":{"observed_at":"2026-08-07T12:12:23.270870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11546","last_updated":"2025-05-27T04:49:35Z","snapshot_observed_at":"2026-08-04T06:10:50.996064Z","submitted_at":"2024-06-17T13:44:20Z","title":"GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11546","snapshot_observed_at":"2026-08-07T12:12:20.068090Z","title":"Gigaspeech 2: An evolving, large-scale and multi-domain asr corpus for low- resource languages with automated crawling, transcription and refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.068090Z"},"links":{"cited_paper":"/paper/2406.11546","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:9b26e286ccb77d3f3ced11c6732b37596e36656b81708a9383384204b3a3a8b8","observation_id":"405fdaac-7213-4d65-b898-1e5404abd152","resolution":{"observed_at":"2026-08-07T12:12:20.068090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:23.029733Z","title":"MOSEL: 950,000 Hours of Speech Data for Open-Source Speech Founda- tion Model Training on EU Languages,","venue":null,"work_id":"df9d9ae2-3cca-4955-a1bb-40a412fcd5f6","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.156850Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:3f50770dd3a055b6e07793946fdb2327d1ed5c3be114dc1bb5c4110dc06cd1b4","observation_id":"b61a362a-029f-4875-a106-8c302d761e8b","resolution":{"observed_at":"2026-08-07T12:12:23.100262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.868148Z","title":"CTC-Segmentation of Large Corpora for German End-to-End Speech Recognition,","venue":null,"work_id":"4255983c-a6de-456b-862e-f40c5b99ea1a","year":2020},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.255300Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:21de7cd0141fca212763db3cb55ed96b7e366bcf3a75661525ddbd17d464bd07","observation_id":"037e1b2f-f68f-4680-9328-3b76ff9c7ab4","resolution":{"observed_at":"2026-08-07T12:12:22.956806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-07-06T05:02:39.487370Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-08-07T12:12:20.365163Z","title":"Bag of tricks for efficient text classification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.365163Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:2070b6d9bf0cbea2b009976d2ef37f7aa3624b1221905d52d40ea511839a3505","observation_id":"ff89a244-e405-41d6-a38f-b4a7e9909921","resolution":{"observed_at":"2026-08-07T12:12:20.365163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-07T12:12:20.479161Z","title":"Fast- text.zip: Compressing text classification models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.479161Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:7eb8ee8b44d99c8c7e1889618cb746905c19366e494931c6478a132e19953f4c","observation_id":"2207002f-9773-4956-b514-6e8c6148b10c","resolution":{"observed_at":"2026-08-07T12:12:20.479161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-07T12:12:20.555853Z","title":"Ravanelli, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.555853Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:b1659bcec5a25b69447caa0141ad3f443512f94b4d37b5953cc8219fbe6ff975","observation_id":"a1278efc-5e62-4b40-95e9-1fc712b23bd1","resolution":{"observed_at":"2026-08-07T12:12:20.555853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T12:12:20.661052Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.661052Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:69fb7accbf36037fe2a8f05389ac001bce6a8eea2ca22832835a7df32b0549e9","observation_id":"39e7fa83-9333-474a-b8a6-85f1307ad3fb","resolution":{"observed_at":"2026-08-07T12:12:20.661052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.724395Z","title":"Pytorch: An imperative style, high- performance deep learning library,","venue":null,"work_id":"e4b3bf5f-f497-4b1b-a8ff-1a51ef397cfb","year":2019},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.741492Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:554e33fc1c59e4e48d47640f1c7e4f78f6458350fd1075a9db3032cf97fe4f47","observation_id":"2b5be670-959e-4d36-82bc-9f0fba6c716b","resolution":{"observed_at":"2026-08-07T12:12:22.792853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.574007Z","title":"FlashAttention-2: Faster Attention with Better Paral- lelism and Work Partitioning,","venue":null,"work_id":"32931a58-90ed-4685-8351-3bea04c01981","year":2024},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.824229Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:b5b3c470702ec0795fa35a1781e53542d0d245ddea8448ad8962f1949959e149","observation_id":"8e7d6a8a-75ae-48f8-ab33-a35fe2579cab","resolution":{"observed_at":"2026-08-07T12:12:22.648375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.387762Z","title":"Decoupled weight decay regular- ization,","venue":null,"work_id":"fdfcce79-7061-4da1-a206-836f590a6756","year":2019},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:20.908318Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:9717ab4fd90002bdf47527eac66b781f8c4c40540338c7512630bffe372c9753","observation_id":"59c95f76-2645-43e3-8463-5e7bbf4706eb","resolution":{"observed_at":"2026-08-07T12:12:22.469508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.225692Z","title":"CoV oST 2 and Massively Multilingual Speech Translation,","venue":null,"work_id":"a8875d03-2598-4270-baff-a74d432aeae0","year":2021},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.008812Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:8baf4fd48a65201dd504060fbcf379f0b91a80891cd1ab967095ebb399456f88","observation_id":"9ab61f24-357c-4dfc-915a-db9a72d7dfc7","resolution":{"observed_at":"2026-08-07T12:12:22.314269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:22.067868Z","title":"FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,","venue":null,"work_id":"70b2c522-df4f-4023-b3ad-2c9d0d07543a","year":2022},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.049823Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:4cf8421851e708b58a1ab51d8c03afe19f042280aef6423e1c6d4dd6da135517","observation_id":"820967f7-1ead-4b55-b5d4-46b2b45fe252","resolution":{"observed_at":"2026-08-07T12:12:22.131499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T12:12:21.094758Z","title":"MLS: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.094758Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:ca0b91b222d08696ae5f673908fed117aff85d8deb777fb10c658a4034432ff8","observation_id":"d196b4a7-095d-443c-b774-7b1f45f97f0c","resolution":{"observed_at":"2026-08-07T12:12:21.094758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:21.901637Z","title":"Srivastav, S","venue":null,"work_id":"85bdc1e5-1649-49e9-9303-20653676d8c1","year":2023},"citing_paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:21.174309Z"},"links":{"citing_paper":"/paper/2506.00338"},"observation_digest":"sha256:2cf842fe900db9611013159988659de11395a73b989848a66a2f395289147e49","observation_id":"48a6f4de-4db2-4861-8697-d222a52175a2","resolution":{"observed_at":"2026-08-07T12:12:21.979286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00338","last_updated":"2025-05-31T01:44:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T00:02:48.033237Z","submitted_at":"2025-05-31T01:44:44Z","title":"OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2506.00338."}