Pith. sign in

Paper Citation Record · LEDGER

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 4 inbound Pith citation observations for arXiv:2508.20869.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.20869 v1

Coverage vector

measured 46 of 46 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T14:49:35.967250Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-02T21:10:10.548489Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T21:17:24.052151Z

Reference resolution

46 of 46 outbound references displayed

  • verified exact3
  • verified fuzzy6
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2b8c50fa-f0f8-417f-a0fc-6962fa20a289 · outbound

This paper cites @esa (Ref.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models @esa (Ref

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.827193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.827193Z digest=sha256:3dea82604f4d88d1ae8aa871609a1adbfa4bfc38dbf6a423e51fe245ad1109fe

Observation f16ef826-5966-4f1c-8ea6-b9be03bdf4df · outbound

This paper cites an unresolved cited work.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.831299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.831299Z digest=sha256:b3987f15630ca5f15f36421bee82f6c7caa6cc65ca4e7c6f724bbbcc72fa856e

Observation a4027b5a-dcce-4b5b-871c-3a83db69eec0 · outbound

This paper cites an unresolved cited work.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-05T14:49:36.441119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.834278Z digest=sha256:ea4fd5c6001baa5262d95b98f3d4e83ff6a0fc813db1b86d2da5e4e615d35525

Observation a53be3aa-8ec5-4309-b258-77b552674705 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models wav2vec 2.0: A framework for self-supervised learning of speech representations

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.435029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.837259Z digest=sha256:1d8a90069b49c16a72d982a904ca4844426227684267f8ef7e754f42abb99fdb

Observation 9ba26393-fdbb-4c70-9dcb-01279cbf245d · outbound

This paper cites Language models are few-shot learners.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Language models are few-shot learners

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.840408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.840408Z digest=sha256:9df40e5597a9eda0335ae236ec67f1585ec7410c8657a261ff569ce29e577678

Observation 45cc14a7-fb7e-4e29-a232-d72a61ef2a0d · outbound

This paper cites SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-08-05T14:49:36.379813Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.843471Z digest=sha256:851d2d20bc0b655aa16b7327129a34b1238c6d2cee08275d1ed3e52037d22975

Observation 77a92c45-9749-4bec-8106-a5f7d4a62324 · outbound

This paper cites Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.846918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.846918Z digest=sha256:2d4c4f29e259b6d3b26844916ba2d42a569bd3cecb3d69647a293f6d0c71b553

Observation 682c347c-a3de-4380-a712-7fb23f8f29a6 · outbound

This paper cites OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.850120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.850120Z digest=sha256:3c50fdafeabfe1084f9d213a340d34a1cad565e504d26e75fb7d17900e6ee7e2

Observation 900ae064-977c-4d74-a7aa-572e700eb92e · outbound

This paper cites Reproducible scaling laws for contrastive language-image learning.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Reproducible scaling laws for contrastive language-image learning

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.424818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.853152Z digest=sha256:199a997a9448bc3a4dd2976780582c17575e71010fa907cfa057d3c365704a0f

Observation ec9f8455-9b87-4e8b-b0a1-64b3bed78d71 · outbound

This paper cites SeamlessM4T: Massively Multilingual & Multimodal Machine Translation.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.856563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.856563Z digest=sha256:ecb56946991e883b9f78e3b18d9d7292e0adbc8f7366516560d652b017571f40

Observation 7d4ac54e-3603-4ae0-abf1-14c3a91fc101 · outbound

This paper cites FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.860132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.860132Z digest=sha256:7d9ff0af1a2024d1820c3586b597c291cbe0d81472438634db5be73e50074833

Observation 49de9e24-2ce4-41a7-af47-255dcafe2c67 · outbound

This paper cites Scaling Laws for Multilingual Neural Machine Translation.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Scaling Laws for Multilingual Neural Machine Translation

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-05T14:49:36.351712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.862939Z digest=sha256:b9a7b25cac1dd5e8011edab00d57540c0f676d1f9def3cf4fb76f73c64f81595

Observation d25db10f-bf85-49ba-8cf2-497a4913b655 · outbound

This paper cites Datacomp: In search of the next generation of multimodal datasets.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Datacomp: In search of the next generation of multimodal datasets

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.418245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.865667Z digest=sha256:c047c492fdd9021d80e06e122f2418b2c97b9f2084cc819b95a80f6e32ba9c7d

Observation 1f432fba-6a92-4c8f-ba9c-161a51041198 · outbound

This paper cites The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.411406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.868641Z digest=sha256:d7c8b7e59e815c6d54e99d9c23766e4db0da636dee5f8a101d050adaeaaaf67d

Observation c4d2256f-1af1-4c47-afca-c6063468fd93 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.871166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.871166Z digest=sha256:91ca332ff680e3757be0afa91eb4c47c2ce8e6882ce542638ec013ec94236a89

Observation df4d36fb-7e8e-4b06-8ba3-4f5ac8b3c22b · outbound

This paper cites The Llama 3 Herd of Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The Llama 3 Herd of Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.873799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.873799Z digest=sha256:1688a8a17d9ca10fc8c266e7c0267f17641e0150c8b3f6a9bb71d20edc2c6ab0

Observation b3ce6c97-49e4-41d6-96eb-d9643dce6b3b · outbound

This paper cites Efficient Multimodal Learning from Data-centric Perspective.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Efficient Multimodal Learning from Data-centric Perspective

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.876386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.876386Z digest=sha256:0c08d97f999781a121db356ebd28a3253ca50d92aff2ab72b081167e5e856703

Observation 98a64b3f-70a1-4121-85f3-e749e9c46dc6 · outbound

This paper cites Datacomp-lm: In search of the next generation of training sets for language models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Datacomp-lm: In search of the next generation of training sets for language models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.879751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.879751Z digest=sha256:d321db854c1435e7fcb8733641cbbfa2522a9bab25891c9ab12f5091e297a67a

Observation 15706592-4249-49e8-a104-c2c60afb24af · outbound

This paper cites DataComp-LM: In search of the next generation of training sets for language models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DataComp-LM: In search of the next generation of training sets for language models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.882505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.882505Z digest=sha256:f9c049ea48be3c758df488031250e0b5828077633cc06f1b3c30622c35a96dcd

Observation b3033071-6ef2-4481-a540-b6cb3f3d187b · outbound

This paper cites Rethinking evaluation in asr: Are our models robust enough? In Interspeech 2021, pp.\ 311--315, 2021.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Rethinking evaluation in asr: Are our models robust enough? In Interspeech 2021, pp.\ 311--315, 2021

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.887365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.887365Z digest=sha256:ff97cb9f157770d27ebf563cc5efcd7996f783b1dc384ec86c72e82a3c191e47

Observation 44e52e4f-419e-46c2-b98f-5d8cde48215b · outbound

This paper cites DeepSeek-V3 Technical Report.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DeepSeek-V3 Technical Report

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.890603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.890603Z digest=sha256:a7fa42edc7fe22d10b0a356a64065885722a3250e39004d0757402114d26ebdd

Observation 23ba3bb7-ef77-40eb-b1f1-c8529bb137ec · outbound

This paper cites LLM360: Towards Fully Transparent Open-Source LLMs.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models LLM360: Towards Fully Transparent Open-Source LLMs

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.894108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.894108Z digest=sha256:5b0921cf4ecd2194b637178ce2499976f8a42f06d6e1f0d05dbde31f341bad79

Observation d156c2fd-ff8e-48a2-8f0e-6b0293a3bee1 · outbound

This paper cites 2 OLMo 2 Furious.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models 2 OLMo 2 Furious

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.897657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.897657Z digest=sha256:d3d2bf701779c5d22bd8d8f3d0b6577f9b4f88a0205bc54604c7ca7bff407d1c

Observation c2196ac7-8ad0-4723-acd5-19f6cce95cee · outbound

This paper cites Librispeech: An asr corpus based on public domain audio books.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Librispeech: An asr corpus based on public domain audio books

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.900735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.900735Z digest=sha256:1e311020782329177a63feb193c866031f4940923d361c9a27582f663116fa3e

Observation f43bc6f8-36e9-4053-a450-7fe1f5adf9f3 · outbound

This paper cites The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.904903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.904903Z digest=sha256:e45264252e0720006b8ae6fc3720b9ff24b7538cc0ba06e0ab72a604bc1a0694

Observation db348dcf-507a-424a-8bd9-943dfe95ab13 · outbound

This paper cites The fineweb datasets: Decanting the web for the finest text data at scale.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The fineweb datasets: Decanting the web for the finest text data at scale

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.401363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.907582Z digest=sha256:fdd4fdfaf84fbd3e6d7c3a05db1c05cbb6867da2f41e4ed7eaf148c04a573090

Observation 2032668c-45c6-4755-aa53-316aadf83f6e · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.910924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.910924Z digest=sha256:415b055e43bab366845b6aaa651f513cffb3a458e1a1398536aafe6588b614c9

Observation 5b59844e-4f31-4822-b333-b467f11128a9 · outbound

This paper cites Reproducing whisper-style training using an open-source toolkit and publicly available data.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Reproducing whisper-style training using an open-source toolkit and publicly available data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.914257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.914257Z digest=sha256:6b542a6e53aee2fed50a20b8fc238de9b1bdd0309486c5fe7c8136825614603e

Observation 3a539e18-0e44-4631-99f0-f9e9a2daff54 · outbound

This paper cites OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.917170Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.917170Z digest=sha256:71cd1f455488c8fefb5e0b2515b4b41a603f16b4ec7a401e448ae10b7ff9e981

Observation c1ffe5bb-8b3f-4a31-8075-8def0d103b4d · outbound

This paper cites Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.919841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.919841Z digest=sha256:a9026a67fca702582d4d99cf83da6e4db913a188d210a746d2924a5fac6b741e

Observation 444997b4-757c-49bc-ab06-4ef088401716 · outbound

This paper cites Learning transferable visual models from natural language supervision.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Learning transferable visual models from natural language supervision

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.922387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.922387Z digest=sha256:4db7b33b79021325721f75996a084a0a057c1c1b83bbb9e0dc040beaa0510491

Observation 4b47c52b-4b1e-43b5-bf2c-1a96ec6a7867 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Robust speech recognition via large-scale weak supervision

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:49:36.390684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.924817Z digest=sha256:cbbc7531fc439f417ac1276b113d9a0bb9497856fa8266f6611883eb4b6088dc

Observation 00330330-7067-41b8-bec8-20d2a45472be · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.927960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.927960Z digest=sha256:e61460853b47270446c0b588ee55af994ba953561c387a4090f07fdd3e0be867

Observation f304045c-cd08-4355-b774-f76ba91bb9b5 · outbound

This paper cites Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.932276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.932276Z digest=sha256:d832d40f36d7ea13d60a30105d6a1faa20e257d14bdeb79991b1f27341e039cf

Observation 606c1c1d-beae-4e9d-9c5f-10930968c799 · outbound

This paper cites Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.938335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.938335Z digest=sha256:dde67fc1e30b5c691b1814443c73fe63296ceb0413b7c26775a28ed1ffaa64a4

Observation f56c8549-05ae-4d8e-9a25-9dde37f1253d · outbound

This paper cites Measuring Robustness to Natural Distribution Shifts in Image Classification.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Measuring Robustness to Natural Distribution Shifts in Image Classification

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.940391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.940391Z digest=sha256:587d5c5287e00486e096bd7df805b180c18ee4970ee3fd9bda5edadd19d5f2f6

Observation 223cd14b-baee-42f1-b604-dbb1fa6504aa · outbound

This paper cites On the effects of heterogeneous data sources on speech-to-text foundation models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models On the effects of heterogeneous data sources on speech-to-text foundation models

Reference 39

Resolution
verified exact
doi, observed 2026-08-05T14:49:35.989918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-08-05T14:49:35.942809Z digest=sha256:479dbe4993c9ff328a3602d64c060aac73c731e732030bcf569ae6a905e33bc7

Observation 2b765152-9b23-41e0-84b7-b63503410427 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models LLaMA: Open and Efficient Foundation Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.945053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.945053Z digest=sha256:ae726a3a54816b7b7f3ddc96f50371ec3fa47035ce807e5d7a3bd9b7aaa26e16

Observation e62ff4b9-ec51-430b-bf83-86240aaabf4c · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.948029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.948029Z digest=sha256:6b83d04b800fbd9fb95d0cb922344e3b7d8b77834732b1b01b3b79c6616f42ea

Observation b87bb6eb-8172-433f-af4f-c0fb32fccca0 · outbound

This paper cites Voxlingua107: A dataset for spoken language recognition.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Voxlingua107: A dataset for spoken language recognition

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.950291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.950291Z digest=sha256:4047d0ad62c74fda6afe4771c69d360b25acf6d1b9f0fdd898cc7e13317880cc

Observation 9bbf3e5f-ac51-4f10-b045-a2f423eafe06 · outbound

This paper cites RedPajama: an Open Dataset for Training Large Language Models.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models RedPajama: an Open Dataset for Training Large Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.952702Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.952702Z digest=sha256:4d8bfe8887917380bb4fd6ba3c9101a5cf4b421045ed1f60e96da318dd2cfbe4

Observation 500cc621-014d-4ca1-914c-b7e5bd093270 · outbound

This paper cites Organize the Web: Constructing Domains Enhances Pre-Training Data Curation.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Organize the Web: Constructing Domains Enhances Pre-Training Data Curation

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.955400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.955400Z digest=sha256:3945e8ffccc10410e079e24182ca2835af1acdd04f5c94dc485d5cd2a1109dd4

Observation aa64a33b-78f2-4518-9c6d-f1ca4c9108fa · outbound

This paper cites DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.959110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.959110Z digest=sha256:ac2dbdb9332b305487e5a2998b8953c23deb5b8057dcc1c664b4fcad9c073044

Observation b806ff3e-2605-4b83-bbff-f5c55da9154e · outbound

This paper cites an unresolved cited work.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.961665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.961665Z digest=sha256:ee75f7a0d4608a571bb00c61551af980ac158121cd974a978549f07633659575

Observation 7c66f95f-54e2-4129-8f2b-fcf6e94d283b · outbound

This paper cites Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.963931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.963931Z digest=sha256:36afd820610e4bd00da6da177879dc07cdb975691a512ac3fc6a75069e975526

Observation a80264bd-ed9d-4d98-a048-9c506230b79f · outbound

This paper cites write newline.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models write newline

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.967250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.967250Z digest=sha256:4988b343ca2bb8c1449e4a5b84af0efcead796aa34411925160a10242e372da9

Pith citing papers

Observation fc227c8f-de6e-4312-a76f-d511be3e2bc3 · inbound

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR cites this paper.

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-11T08:40:59.456272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-10T16:33:32.012025Z digest=sha256:47947d66f94c99f9036afeb89998cb0406e481c4621123b972bd257cc3bddf8c

Observation 1ab59163-2d05-4b37-ae87-60233f5037e2 · inbound

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech cites this paper.

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-21T02:33:55.441620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-05-21T02:32:26.122526Z digest=sha256:b9cd49b485198ce452a427acf47034b3ad7dcdba8b597582599a9ed7e24f9d1b

Observation e0bf5466-55f8-4e85-b4b5-6beb854b3f21 · inbound

DataComp-VLM: Improved Open Datasets for Vision-Language Models cites this paper.

DataComp-VLM: Improved Open Datasets for Vision-Language Models OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 223

Resolution
verified exact
arxiv_id, observed 2026-07-01T15:35:48.916940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-30T01:16:16.834861Z digest=sha256:f74c8f1b6c3c6297c278bb5aa981f5fa4af4fcbd46df59714c5143e9bfc068aa

Observation 43956712-4451-4d17-a601-c845e809003c · inbound

DataComp-VLM: Improved Open Datasets for Vision-Language Models cites this paper.

DataComp-VLM: Improved Open Datasets for Vision-Language Models OLMoASR: Open Models and Data for Training Robust Speech Recognition Models

Reference 223

Resolution
verified exact
arxiv_id, observed 2026-07-02T21:17:24.054380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-07-02T21:10:10.548489Z digest=sha256:c2c185dc25e7019c9885a89f1c09e23df5aa293cc56d066785cc8867856ded5c