{"as_of":"2026-08-14T07:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ada7977887b747f9fb1de55573648c1e15b46fb3fac188944bae4a516dffcfeb","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:49:21.783339Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:49:18.926273Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:49:22.026276Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"cited_work":{"arxiv_id":"2505.21578","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21578","snapshot_observed_at":"2026-08-07T13:49:22.026276Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","venue":"cs.CL","work_id":"c1edcb83-2bba-4b7a-a700-ab92e5e3f77d","year":2025},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:18.926273Z"},"links":{"cited_paper":"/paper/2505.21578","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:cbc752899cd90a5fc6d89ffe1ad03caa2ae891ec826698708f87b47fe1f30594","observation_id":"2232aa19-443b-418f-9e68-3cfda600b704","resolution":{"observed_at":"2026-08-07T13:49:22.160440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21578/citation-record","integrity":"/paper/2505.21578/integrity","json":"/paper/2505.21578/citation-record.json","paper":"/paper/2505.21578"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:24.241995Z","title":"open-source","venue":null,"work_id":"82a58939-bc6b-4214-9c18-d1012cf9a492","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:18.821110Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:d38ebc2186ed0c48bfdff985b5d834d265eed9b0e85c662cc9b6efbb0159299e","observation_id":"86228da0-13b9-456f-bba9-b3845192c19b","resolution":{"observed_at":"2026-08-07T13:49:24.394179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"cited_work":{"arxiv_id":"2505.21578","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21578","snapshot_observed_at":"2026-08-07T13:49:22.026276Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","venue":"cs.CL","work_id":"c1edcb83-2bba-4b7a-a700-ab92e5e3f77d","year":2025},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:18.926273Z"},"links":{"cited_paper":"/paper/2505.21578","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:cbc752899cd90a5fc6d89ffe1ad03caa2ae891ec826698708f87b47fe1f30594","observation_id":"2232aa19-443b-418f-9e68-3cfda600b704","resolution":{"observed_at":"2026-08-07T13:49:22.160440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.801580Z","title":"dev-other","venue":null,"work_id":"db11f889-0275-4f9f-9dd8-ff3323f5fa35","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.100288Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:799e60bb04be66f0d74e2fa92f62c3d4d5075f60fc4de233cf61450fc280ad7b","observation_id":"3cb75ae8-7806-45ed-8591-b197b1d11987","resolution":{"observed_at":"2026-08-07T13:49:23.889982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.685802Z","title":null,"venue":null,"work_id":"9fd5d03b-0fe2-4ba9-ac84-788209b695c2","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.188453Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:ecee86c7c72a980f27e104ed7b48c321200c1df7f2162ed26d263c21085579f4","observation_id":"2f61fc9c-bdac-46c9-bef6-fb1aa54c9974","resolution":{"observed_at":"2026-08-07T13:49:23.743847Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.406243Z","title":"The dataset is easy to reproduce thanks to the SpeechBrain re- leased source code and can be loaded in a single line of code","venue":null,"work_id":"617e82fe-2a40-4816-b001-2a5d0c8d6e47","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.273591Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:80c766af0ad1962fc8f033d113014245256b3185d0773494004d73dd1bb962ff","observation_id":"6921c4be-1ce9-4e8e-8e98-955461dd57aa","resolution":{"observed_at":"2026-08-07T13:49:23.596584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.874157Z","title":"Mosel: 950,000 hours of speech data for open-source speech foundation model train- ing on eu languages,","venue":null,"work_id":"e9886c1b-1d2c-4561-9a2e-4eda438490e9","year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.155009Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:6438340a8d5c196dc589ce49128fbfa5584854a4c7ce393131aa651171be1628","observation_id":"7bb05ae4-89c5-4403-a3fd-02391cb282d9","resolution":{"observed_at":"2026-08-07T13:49:22.936707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.219256Z","title":"The design for the wall street journal- based csr corpus,","venue":null,"work_id":"7b1ffd9f-c2ca-45c9-9019-57fa65084535","year":1992},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.415192Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:35addb02b3d78a7685d77def8f4516cbebbc8a2dc017fd9d6a0adcbd09dabb90","observation_id":"3c5899e0-7220-43a1-9edb-d87e6474afe9","resolution":{"observed_at":"2026-08-07T13:49:23.282469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.067870Z","title":"Darpa timit acoustic-phonetic continous speech corpus cd-rom. nist speech disc 1-1.1,","venue":null,"work_id":"8e37cb17-b7e0-4df2-bc60-31cf03ae068e","year":1993},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.540643Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:5665aadb0fe5db057831eda67b6167a15f5755306f3e5aa22a4d3db2170afe5e","observation_id":"21e858af-ea56-477b-b161-b649dc65e523","resolution":{"observed_at":"2026-08-07T13:49:23.109696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.722000Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.722000Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:39beb23e2d06137d02999aa40d681ed38343298579375961ddf3365f46575426","observation_id":"2833979d-5341-4859-b931-91574bd846d9","resolution":{"observed_at":"2026-08-07T13:49:19.722000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.868605Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.868605Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:3d4f657266268da28f1f9b412913b7aa8aff336650cba23d21bb518f92ff2cc4","observation_id":"e3b28d05-9402-41ee-a114-f234b230419b","resolution":{"observed_at":"2026-08-07T13:49:19.868605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07341","last_updated":"2024-04-12T18:23:35Z","snapshot_observed_at":"2026-08-13T00:33:06.087454Z","submitted_at":"2024-04-10T20:40:24Z","title":"Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07341","snapshot_observed_at":"2026-08-07T13:49:20.016438Z","title":"Conformer-1: Robust asr via large-scale semisupervised boot- strapping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.016438Z"},"links":{"cited_paper":"/paper/2404.07341","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:a2e65eded743032909d97388e90726d1ac06fe8f0d7d2726b2db1da88aae88e4","observation_id":"27e30a3f-6914-4aef-b1de-f9656e08d8ce","resolution":{"observed_at":"2026-08-07T13:49:20.016438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-13T19:04:39.932284Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T13:49:21.093321Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.093321Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:82ffcd1c25e87798310aabf4b9c32f8763b55ea1b70b04a54bcbb71795ac49e1","observation_id":"48f8d9f6-776d-4b89-85bd-820eb4c85620","resolution":{"observed_at":"2026-08-07T13:49:21.093321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:20.351770Z","title":"Yodas: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.351770Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:929d602dcd8585f4ad11e3e4183c6d9daa9aacb21aa0cca86116495b8dc6fe84","observation_id":"06f76e27-7e8b-4b08-bc88-fe1b898c0c92","resolution":{"observed_at":"2026-08-07T13:49:20.351770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.735504Z","title":"Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,","venue":null,"work_id":"a9c5b6d2-4b4e-418a-bcea-2ef621460952","year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.544196Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:76bc0b40c9df695e1e12c50bce577e5a6eb51dd80f0cfb6f7721f2a6ff37d89c","observation_id":"f10eea87-3652-4171-bb8e-2ae55c4a4af5","resolution":{"observed_at":"2026-08-07T13:49:22.780955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.968480Z","title":"People’s Speech [9] and YODAS [7] are the most recent attempts at overcoming the read versus spontaneous speech issue at large scale","venue":null,"work_id":"f1fa4e6e-46a6-4f43-8104-c73c3ce928c3","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.029598Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:4799c36c921251369ede1e809d848f5eab1bd023547d813f1d26dfb8f1c1b046","observation_id":"287cf320-8e23-46a3-8c7c-cad2c419ef2f","resolution":{"observed_at":"2026-08-07T13:49:24.045529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-13T23:18:35.311116Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T13:49:20.652179Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.652179Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:e6ee10c9fc46b59a619ce9c9c1e243f102248ae4de1db60b79aedb4c30c5a25c","observation_id":"d94107cd-9278-4f9c-abfd-72870ccb72d7","resolution":{"observed_at":"2026-08-07T13:49:20.652179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-14T06:46:28.505083Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-07T13:49:20.806789Z","title":"Speechstew: Simply mix all available speech recognition data to train one large neural network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.806789Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:73379713f4786f1d023ce655b0f111fcbca090c40abf8031424a70f6ec47a555","observation_id":"fc3ba030-0bf9-4472-86b6-df1c827b9927","resolution":{"observed_at":"2026-08-07T13:49:20.806789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:20.960789Z","title":"Reproducing whisper-style training using an open-source toolkit and publicly available data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.960789Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:6f7b25bcea18e4e431c142ac91c18d40f98025354bbe5de1e0b5b37c8b1a5514","observation_id":"4794e4e2-7e1b-4afe-96ca-bf96996520d8","resolution":{"observed_at":"2026-08-07T13:49:20.960789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T13:49:21.198546Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.198546Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:0a8513d6ab6a4383cff2cfb42ae3fd4152046529f30cc864b5f984abeed0f9ca","observation_id":"9dc565a7-c1be-46a6-9342-50d71a9f83fe","resolution":{"observed_at":"2026-08-07T13:49:21.198546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.549995Z","title":"Open-source conversational ai with speechbrain 1.0,","venue":null,"work_id":"d204f733-c94c-4a66-b65f-a30c1565fd4e","year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.352107Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:63bcbf692254febd00e66b7f83d58f1b14da8dca9cb4be0aba6916cbc38c1b61","observation_id":"39e6ca45-5e08-4ef6-acb3-1f1219484f0a","resolution":{"observed_at":"2026-08-07T13:49:22.623249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T13:49:21.471158Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.471158Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:7d3a45ccfbed9b39728092b02c5d6f1915efe69ac155efe3774ed2d2d3dfe338","observation_id":"80bb602e-4d01-4b5d-82c3-8a56169d6738","resolution":{"observed_at":"2026-08-07T13:49:21.471158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.390428Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":"9800ca8a-cb51-40fa-a295-15cc1f4fbd88","year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.645978Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:a3aad9c6f975366450740c7a0020459288fbcaa0ab9e2641b88c0d2f5fe2059e","observation_id":"44b33b1d-a72a-4c23-94b9-0f3acd44b9ea","resolution":{"observed_at":"2026-08-07T13:49:22.464684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.266811Z","title":"Joint ctc-attention based end-to-end speech recognition using multi-task learning,","venue":null,"work_id":"f2a494b9-34df-4675-8632-131c4378e70a","year":2017},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.783339Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:b816f886d5353cbae33f03704aaaafe50140ae1b8e61a6d2680d72e6316065e9","observation_id":"a99041cf-c46f-4689-bd42-82de3fd80fbb","resolution":{"observed_at":"2026-08-07T13:49:22.319240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T23:33:03.434750Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2505.21578."}