Pith. sign in

Paper Citation Record · LEDGER

Data Efficacy for Language Model Training

As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2506.21545.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.21545 v1

Coverage vector

measured 63 of 63 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T22:31:40.416807Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-26T04:49:28.598430Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T13:49:52.413967Z

Reference resolution

63 of 63 outbound references displayed

  • verified exact2
  • verified fuzzy32
  • unresolved29
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3472e36a-d530-47ef-ae56-b2e31262b75a · outbound

This paper cites Training language models to follow instructions with human feedback.

Data Efficacy for Language Model Training Training language models to follow instructions with human feedback

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:19.795365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:19.795365Z digest=sha256:b8eb8f4849845d83446e8e06c01a4aca6e7b96b2b723380dc444101de3671217

Observation 34907434-1239-45b4-88c2-d0f1c4fee130 · outbound

This paper cites GPT-4 Technical Report.

Data Efficacy for Language Model Training GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:34.789743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:34.789743Z digest=sha256:a6ca69d128390a319cee22ac004d86d91cb5a1396df60e4baf33cc5a9193f987

Observation c20a7caf-e52b-4419-ab88-69ffb3476f62 · outbound

This paper cites The Llama 3 Herd of Models.

Data Efficacy for Language Model Training The Llama 3 Herd of Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:34.895488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:34.895488Z digest=sha256:55bc8d1b91f92379719233bb9ff9f654aff1a364f6a6138a570dc897afcb5baa

Observation 109ce30e-a715-4be8-9bde-903bf3f6e665 · outbound

This paper cites Advances in natural language processing.

Data Efficacy for Language Model Training Advances in natural language processing

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:46.230969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:35.076029Z digest=sha256:db04a2a9542fde7d17bbd1564c419924278d7d8ae53087fc0b65ad951a98db3e

Observation 43b7d785-8f9e-4852-8966-d9661c2e5f0c · outbound

This paper cites Exploring Sentiment Analysis Techniques in Natural Language Processing: A Comprehensive Review.

Data Efficacy for Language Model Training Exploring Sentiment Analysis Techniques in Natural Language Processing: A Comprehensive Review

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-08-06T22:31:40.922314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:35.157846Z digest=sha256:cd684c254981489109174256f37aa4ccdfacae5a954abf69b96651b94daeb3b6

Observation 13d9fd78-e418-4d90-ab5a-2a45644dba8a · outbound

This paper cites Natural language reasoning, a survey.ACM Computing Surveys, 56(12):1–39, 2024.

Data Efficacy for Language Model Training Natural language reasoning, a survey.ACM Computing Surveys, 56(12):1–39, 2024

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:35.320880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:35.320880Z digest=sha256:b9215aa72e283934d41e3c123cc7c82c9fdebafdd3408bcfcafc03e7480c07b2

Observation af796198-10d4-423a-b3d0-5532553f81bc · outbound

This paper cites Ai- based conversational agents: a scoping review from technologies to future directions.

Data Efficacy for Language Model Training Ai- based conversational agents: a scoping review from technologies to future directions

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:46.065682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:35.434001Z digest=sha256:e2aaaa62342fbbf422e6219f0cc727b2ff5101ee91595a7b88ab01d5fd5a534c

Observation a1927fc7-0ceb-4778-b125-e5bfacb792d9 · outbound

This paper cites A Survey on Data Selection for Language Models.

Data Efficacy for Language Model Training A Survey on Data Selection for Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:35.530387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:35.530387Z digest=sha256:a15351d56fa879feb2c00f49e5d703eda3e6b468b34b2098862e47761293ffe3

Observation ef3463bf-d78b-476a-ac3e-401d1550cb6f · outbound

This paper cites Data selection for language models via importance resampling.

Data Efficacy for Language Model Training Data selection for language models via importance resampling

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:45.895241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:35.679951Z digest=sha256:09de3530372ab9cd0835151370b1ebe993340da43fef9dce4bc1b945528728d9

Observation e3ec3028-3dba-451f-a437-18ddd3f97bb0 · outbound

This paper cites Data Selection via Optimal Control for Language Models.

Data Efficacy for Language Model Training Data Selection via Optimal Control for Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:35.732689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:35.732689Z digest=sha256:2e15d0f6ee379197d02d58e3c20bcefa1fa460c1b43f275eba4c4b24fe21e842

Observation 9afb825a-41b3-4b1a-ab8e-df850b14d8db · outbound

This paper cites Curriculum learning for language modeling.

Data Efficacy for Language Model Training Curriculum learning for language modeling

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:35.794833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:35.794833Z digest=sha256:e5d35f45cf18cb1e117b3c172a21857538963b3b2cf83b03919faee10738cc60

Observation 5455404c-f873-465e-8537-443144bf71ca · outbound

This paper cites A survey on curriculum learning.IEEE transactions on pattern analysis and machine intelligence, 44(9):4555–4576, 2021.

Data Efficacy for Language Model Training A survey on curriculum learning.IEEE transactions on pattern analysis and machine intelligence, 44(9):4555–4576, 2021

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:35.871785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:35.871785Z digest=sha256:00b4c655a2f25f0938db027cd7a77f778fa4fee3ac994343b768e4bb92e54db0

Observation 181826f8-e99f-458a-b806-4e797e939955 · outbound

This paper cites hello-gpt-4o.

Data Efficacy for Language Model Training hello-gpt-4o

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:45.681972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.032874Z digest=sha256:34a1e5c319533efab1de3df73804ffa23f476729ec53b704d8ced6eaf03b05e7

Observation 732c55b2-97bc-4c44-84b0-dcb59c421d78 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Data Efficacy for Language Model Training Gemini: A Family of Highly Capable Multimodal Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:36.095933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:36.095933Z digest=sha256:10de371ff945793edefdf93b10c61a3404b492580284f77f17fffd6ebf8e91d7

Observation bfed6da5-5d01-4875-bc9d-f1b78466d95d · outbound

This paper cites Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation.

Data Efficacy for Language Model Training Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:36.144310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:36.144310Z digest=sha256:fbb86227388b4d04ced489f2a89c8e785163c82680fc6df9867e8c845e77ca24

Observation 688f2516-476c-4595-b6e0-f95ff308ca9e · outbound

This paper cites Long short-term memory.

Data Efficacy for Language Model Training Long short-term memory

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:36.249863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:36.249863Z digest=sha256:89871bbf4e800c94731ca82872ba9e28d5573f530068751ee655ac027a7ab87f

Observation 6d60b150-431e-4a24-a423-184016f8a3e5 · outbound

This paper cites Scaling Laws for Neural Language Models.

Data Efficacy for Language Model Training Scaling Laws for Neural Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:36.341314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:36.341314Z digest=sha256:4dcad61731b4ef3ff7e3027557c4ef71a2fbfd0142e4d248cf81a5294c9fa1b7

Observation 0858127b-aa58-4d30-8628-25ec4970a281 · outbound

This paper cites Scaling laws for data filtering–data curation cannot be compute agnostic.

Data Efficacy for Language Model Training Scaling laws for data filtering–data curation cannot be compute agnostic

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:45.455618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.403199Z digest=sha256:3c78eed6002d41ff1437440021823460b2a9318e356927650a652922417ba9ee

Observation 02bebf18-ee54-457b-b079-53b8c8b972d8 · outbound

This paper cites KenLM: Faster and smaller language model queries.

Data Efficacy for Language Model Training KenLM: Faster and smaller language model queries

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:45.203086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.509845Z digest=sha256:7552d7c13a03d21449ed39a2cde48e9bdef0a754446fd292aa400558fd66f3dd

Observation 8c87e9eb-75b3-4a0a-9f11-8afdcd28682a · outbound

This paper cites Claude 3 haiku: our fastest model yet.

Data Efficacy for Language Model Training Claude 3 haiku: our fastest model yet

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.984977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.629087Z digest=sha256:7d5072811e758520d9370345a13cb9d0f7cab799c3f31cfc38e7f6bfd6fe6cbe

Observation 1252c827-a720-4254-8352-bdd6bde866cf · outbound

This paper cites Paml 4: phylogenetic analysis by maximum likelihood.

Data Efficacy for Language Model Training Paml 4: phylogenetic analysis by maximum likelihood

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.857188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.737006Z digest=sha256:879f81a212dfb59b34ac87d5023b06ea81c7eb27f757228a2d9698a8058ee134

Observation edcc5ac3-4dc4-4523-a9fe-b72b283f75ac · outbound

This paper cites Common crawl – building an open web-scale crawl using hadoop, 2010.

Data Efficacy for Language Model Training Common crawl – building an open web-scale crawl using hadoop, 2010

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.730683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.842436Z digest=sha256:49ad9cfa5c7e95c52286fdd7cdf1b9298edaded61fa3bc73116df1883ff0e9b1

Observation 2a3c4282-7a05-45db-aa0a-e57051d3bb3b · outbound

This paper cites Project gutenberg, 2004.

Data Efficacy for Language Model Training Project gutenberg, 2004

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.626745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.925600Z digest=sha256:41cda4690b4f8f7c220d90f1afbc8cbde78463433e988d44a73de60eb45d71e7

Observation 1800c862-3d77-4e66-8e4d-b2ff96e97ab8 · outbound

This paper cites Synthetic data for deep learning , volume 174.

Data Efficacy for Language Model Training Synthetic data for deep learning , volume 174

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.504460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:36.983223Z digest=sha256:a3245898608c1c869cc819bd7e72de77f04b5ea5cce860d48eba6e51a925b19d

Observation e1b7d25e-5cca-4c8c-8ae9-ab772e92dc82 · outbound

This paper cites Virtual sensors: Abstracting data from physical sensors.

Data Efficacy for Language Model Training Virtual sensors: Abstracting data from physical sensors

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.406796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.055947Z digest=sha256:15eff2b4005d6c3cfea8046b2502eec7a03445d649548bdd6e4814e6b23e5acd

Observation ef5ba448-e607-4b88-95f1-db06e6d7af76 · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.

Data Efficacy for Language Model Training Exploring the limits of transfer learning with a unified text-to-text transformer

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:37.178879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:37.178879Z digest=sha256:3fc164d5323af54dd95bd5cac2c343d625f89b4f4bb0392f16f2ff7d4cfff430

Observation 53478cd4-9bc4-4938-9b6e-df65e110288a · outbound

This paper cites The refinedweb dataset for falcon llm: Outperforming curated corpora with web data only.

Data Efficacy for Language Model Training The refinedweb dataset for falcon llm: Outperforming curated corpora with web data only

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.320180Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.243725Z digest=sha256:ee30fc7760e03cb8a970be89d7e232ad37fddd0db61b42f47843bc7d84db41b9

Observation 61cb4c60-bc85-4f79-8533-cfae6e3eb1ff · outbound

This paper cites Redpajama: an open dataset for training large language models.

Data Efficacy for Language Model Training Redpajama: an open dataset for training large language models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:37.336209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:37.336209Z digest=sha256:6e6b86897ef894116098e025eb2c295f872c5f3bffebcd5bf3b92a61308001ef

Observation a9af43c7-a9b7-451e-b517-6d0514dd2b55 · outbound

This paper cites RedStone: Curating General, Code, Math, and QA Data for Large Language Models.

Data Efficacy for Language Model Training RedStone: Curating General, Code, Math, and QA Data for Large Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:37.409614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:37.409614Z digest=sha256:2acc1ca92abcea9473207ca8067002e913a07198c6d66d4af4f507dc8ba5a2e4

Observation a2af7a3f-b91f-433b-9166-60a72cc70ff1 · outbound

This paper cites Mates: Model-aware data selection for efficient pretraining with data influence models.

Data Efficacy for Language Model Training Mates: Model-aware data selection for efficient pretraining with data influence models

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.202949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.516009Z digest=sha256:8b95ca63bcfa4f15b5853dccb24cebe17ead47a8c0afb0715ea2eacf2131160b

Observation e7f4349a-1d10-4a6f-a369-fef8925df5bf · outbound

This paper cites Training-free dataset pruning for instance segmentation.

Data Efficacy for Language Model Training Training-free dataset pruning for instance segmentation

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:44.095050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.572752Z digest=sha256:389dcad47c6694cf199abe00eeb8a4a464b311072f0a87cc38cecf8d87edd64d

Observation 5ad266e4-2031-4862-899b-a22d6be16703 · outbound

This paper cites P-diff+: Improving learning classifier with noisy labels by noisy negative learning loss.

Data Efficacy for Language Model Training P-diff+: Improving learning classifier with noisy labels by noisy negative learning loss

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.990600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.620112Z digest=sha256:73748cdf3e2d6c94d497b507401904a4a3bfeeadd160e8bc55afd1f950d7e7b5

Observation 3fb4ae5a-4f96-48e0-9d3f-a804118be1dd · outbound

This paper cites P-diff: Learning classifier with noisy labels based on probability difference distributions.

Data Efficacy for Language Model Training P-diff: Learning classifier with noisy labels based on probability difference distributions

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.881483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.665766Z digest=sha256:4bf25f8ed52d76454b2b06d3b255b03b1ed1cf2b59fcb9fb6963da620cc7f3b8

Observation ea0935cd-49b8-421c-b4b8-883d969337d8 · outbound

This paper cites SemDeDup: Data-efficient learning at web-scale through semantic deduplication.

Data Efficacy for Language Model Training SemDeDup: Data-efficient learning at web-scale through semantic deduplication

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:37.703358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:37.703358Z digest=sha256:4a0dccf5c93ef14098754b9632121f03f5feb0dcaca4f8f940386089a1b60511

Observation e655be23-c353-4bf2-8cc8-0f06301c35cc · outbound

This paper cites D4: Improving llm pretraining via document de-duplication and diversification.

Data Efficacy for Language Model Training D4: Improving llm pretraining via document de-duplication and diversification

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.768535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.798234Z digest=sha256:ef159c27ee150b19e41a8e24e30d68f9d223be189508123d424892af678e770b

Observation 13b16161-46e5-45cc-b23a-cb4b4c4a5f00 · outbound

This paper cites Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning.

Data Efficacy for Language Model Training Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:37.853648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:37.853648Z digest=sha256:13cb16923644082648a6763b8b9a5f6e75886f3c4dcde4df7044e3fc0803fd0a

Observation 4b295c33-2616-43ae-a09a-71f2730342b9 · outbound

This paper cites Does the Order of Training Samples Matter? Improving Neural Data-to-Text Generation with Curriculum Learning.

Data Efficacy for Language Model Training Does the Order of Training Samples Matter? Improving Neural Data-to-Text Generation with Curriculum Learning

Reference 37

Resolution
verified exact
local_arxiv, observed 2026-08-06T22:31:40.710309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:37.971943Z digest=sha256:77c32129edd09326a53f1f4c5c8f4dc1d9ea140617f535cd59852059b6d0c229

Observation 8c0be7cb-f617-4dd3-8ec5-df298404a13f · outbound

This paper cites DoReMi: Optimizing data mixtures speeds up language model pretraining.

Data Efficacy for Language Model Training DoReMi: Optimizing data mixtures speeds up language model pretraining

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.673371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:38.143000Z digest=sha256:6ae0a4b6e39a2612a3724f464abfcf53828b4573c40b56e19ede7839020d09ab

Observation 0b2a68e7-4a68-4024-9700-cf5ce660c34e · outbound

This paper cites Lima: Less is more for alignment.

Data Efficacy for Language Model Training Lima: Less is more for alignment

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.563723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:38.258542Z digest=sha256:facdd3e47570fe5220c4629df778c031a51c228de205dfec84cf2e48e38b0928

Observation ca58f8fa-b5bd-49ec-963f-0d6d9132a0b2 · outbound

This paper cites Openwebmath: An open dataset of high-quality mathematical web text, 2023.

Data Efficacy for Language Model Training Openwebmath: An open dataset of high-quality mathematical web text, 2023

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:38.370698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:38.370698Z digest=sha256:59b978f395f79210894d49676aca78603a8b90604c0dd3d67e2d5c6e1d584a46

Observation 3eb84262-2755-4f47-9c16-039dbd257e40 · outbound

This paper cites MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics.

Data Efficacy for Language Model Training MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:38.509344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:38.509344Z digest=sha256:6ae59a54a0e75d1ab4f256e4cb7573e6bef4a41ac080e96a8a9d8a527be67046

Observation b18f4e11-793c-4db5-b71e-5e668be63f4a · outbound

This paper cites StarCoder 2 and The Stack v2: The Next Generation.

Data Efficacy for Language Model Training StarCoder 2 and The Stack v2: The Next Generation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:38.679922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:38.679922Z digest=sha256:6b5dfb50ccfd25a82c0c1523b7b97af27a82a025c677812923dce2cb27f279c2

Observation f1c0a048-7337-4760-b423-606723280f2d · outbound

This paper cites Epicoder: Encompassing diversity and complexity in code generation.

Data Efficacy for Language Model Training Epicoder: Encompassing diversity and complexity in code generation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:38.794928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:38.794928Z digest=sha256:dee46eec1be5d40401ae49d51cd3f591218d552515992d65ee09326f18491439

Observation 7eaf93f6-b84b-47a9-af78-a170358f2de2 · outbound

This paper cites Mistral 7B.

Data Efficacy for Language Model Training Mistral 7B

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:38.889964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:38.889964Z digest=sha256:c4ddb511b5466db514b594397e737b299a9eb428c741479b5196576259c11989

Observation e5ee4398-ee2c-41cb-a1c9-f5e6ec0c7bf8 · outbound

This paper cites Qwen Technical Report.

Data Efficacy for Language Model Training Qwen Technical Report

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:38.997852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:38.997852Z digest=sha256:1254e0899d9ec92d72e091e030fe9af359b4444b47b62e9c85afd89c769c8dbe

Observation 3bb581e0-945e-4cf0-bbb4-8478a8f754fd · outbound

This paper cites OLMo: Accelerating the Science of Language Models.

Data Efficacy for Language Model Training OLMo: Accelerating the Science of Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:39.060536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:39.060536Z digest=sha256:ccc9d1e8772ddb3ede0869a5daa9a61182f01a2653ab556eaec4a26a36096931

Observation 0e32dec9-e955-44f6-b0b1-f9a89ceda0eb · outbound

This paper cites Hellaswag: Can a machine really finish your sentence? In Proceedings of ACL, 2019.

Data Efficacy for Language Model Training Hellaswag: Can a machine really finish your sentence? In Proceedings of ACL, 2019

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.416290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.121670Z digest=sha256:4f45c281bfea5bffd922680cb405eabd92ffaeec78a787daaa940d9ed0fd42ec

Observation d30f3ec4-a3b1-498c-b6e9-edfd1ef90b55 · outbound

This paper cites The winograd schema challenge.

Data Efficacy for Language Model Training The winograd schema challenge

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.234992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.177098Z digest=sha256:242a031e72bf333b861b6d3084b00231194be016ee6e8258858af7ae5fac6b0e

Observation 1f834b77-8d9d-473d-b3fb-7b758a0a26b8 · outbound

This paper cites The lambada dataset: Word prediction requiring a broad discourse context.

Data Efficacy for Language Model Training The lambada dataset: Word prediction requiring a broad discourse context

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:43.085204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.220870Z digest=sha256:c7636c332a3d150fdf2af88958ca127565034fd184a9885e03a74f162bbc4811

Observation 6aa43bff-0821-4ecb-9854-5b3586e92bc1 · outbound

This paper cites Can a suit of armor conduct electricity? a new dataset for open book question answering.

Data Efficacy for Language Model Training Can a suit of armor conduct electricity? a new dataset for open book question answering

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:42.927964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.290035Z digest=sha256:cfd737e07b58b94736b3fdfa332450176808faa2c874981bccbfc40fdcddc174

Observation a029a61f-bf3a-4d63-8253-7a5d63fb8916 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Data Efficacy for Language Model Training Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:39.363914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:39.363914Z digest=sha256:9bcf328f0f4c154fd924ac6a9354638507c3f9df6cf631a3007e868b4203276f

Observation fc872b53-e93a-4a05-a77d-65bd721bfd29 · outbound

This paper cites Piqa: Reasoning about physical common- sense in natural language.

Data Efficacy for Language Model Training Piqa: Reasoning about physical common- sense in natural language

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:42.710576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.444920Z digest=sha256:923964392d31f23102f5ab3223199709fc262be3a50f5f13b5bfb481a3d141ce

Observation f407e16b-dd00-4152-aab2-32f538352ad5 · outbound

This paper cites Liu, and Matt Gardner.

Data Efficacy for Language Model Training Liu, and Matt Gardner

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:42.527336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.518996Z digest=sha256:270799b8756cfed238fbc8a639208e03a9fad8f446127d2077ed4e47b16a8a52

Observation 451ce2a6-f0a4-45f6-9ee0-4059911f2b09 · outbound

This paper cites BoolQ: Exploring the surprising difficulty of natural yes/no questions.

Data Efficacy for Language Model Training BoolQ: Exploring the surprising difficulty of natural yes/no questions

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:42.323259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.599850Z digest=sha256:ab6d0d7f9fa30f3c8a6e4331b97dd511dc108a6d8b7ca8989dd3d3a833c6e278

Observation fa2ec6e9-33ea-4869-8e1b-9ea6d509a64e · outbound

This paper cites an unresolved cited work.

Data Efficacy for Language Model Training Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:39.689642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:39.689642Z digest=sha256:2d36f1c73531fd34ed5dd3a2845f28c841603646c067542782075bb3840ac105

Observation 17350254-b8c4-48a4-8322-bfa482950b43 · outbound

This paper cites Mathqa: Towards interpretable math word problem solving with operation-based formalisms, 2019.

Data Efficacy for Language Model Training Mathqa: Towards interpretable math word problem solving with operation-based formalisms, 2019

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:39.764554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:39.764554Z digest=sha256:03f5cf4a1a787c1dc3ce9f75c628508dfb2dd9792ac211863b6c3ea43270098d

Observation 9caa4a74-9795-4b26-ae42-fdb2e2fb3e54 · outbound

This paper cites an unresolved cited work.

Data Efficacy for Language Model Training Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-06T22:31:42.162493Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:39.849319Z digest=sha256:86758fe9f4355e8482fd53d426d40adefef4a2c6dc2d0de34ce6f189597ca823

Observation ed73ddf4-2c92-400d-a2e8-1fc17282ccd3 · outbound

This paper cites Program Synthesis with Large Language Models.

Data Efficacy for Language Model Training Program Synthesis with Large Language Models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T22:31:39.955344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:31:39.955344Z digest=sha256:ba4de2e1f09fdaac158628e323d1222b5c713ca7cc5856a4cf73e8a9968edd4f

Observation 752b0d3d-0c92-47dd-aad2-1212e2992466 · outbound

This paper cites Efficient large scale language modeling with mixtures of experts.

Data Efficacy for Language Model Training Efficient large scale language modeling with mixtures of experts

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:41.973753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:40.039407Z digest=sha256:8047d357963d86dfbf60384284fc82905ebdc2d86f26d8b3941a0f7084e1d4ae

Observation bd642587-8300-4094-999f-0cd460e8c61d · outbound

This paper cites Decoupled weight decay regularization.

Data Efficacy for Language Model Training Decoupled weight decay regularization

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:41.786740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:40.140435Z digest=sha256:449edd2cac0dc7f7037ae72e3614d0ecf56556f6ffd6a36d8e8ef514b73f146f

Observation 2bc119d4-5638-4b74-be28-6607582b63c6 · outbound

This paper cites Comparing the pearson and spearman correla- tion coefficients across distributions and sample sizes: A tutorial using simulations and empirical data.

Data Efficacy for Language Model Training Comparing the pearson and spearman correla- tion coefficients across distributions and sample sizes: A tutorial using simulations and empirical data

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:41.578495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:40.240414Z digest=sha256:a035d79478f05ca4c4f933c836114d6cf1c1760a0353b14a23222037c0b76914

Observation 6d65bff9-d365-460a-af49-54a81ef4cd17 · outbound

This paper cites As described in algorithm 1, we apply a linear transformation to the mean-pooled representations of instances along the sequence length.

Data Efficacy for Language Model Training As described in algorithm 1, we apply a linear transformation to the mean-pooled representations of instances along the sequence length

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:41.369377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:40.328843Z digest=sha256:3b930519e3b7bb5e6d9d0781d30ee876df45847438fc6421ab8b816001c550ee

Observation dc04d5f7-4d10-422b-bf68-e651558f3866 · outbound

This paper cites I am overpowered by the discovery of my own genius for management.

Data Efficacy for Language Model Training I am overpowered by the discovery of my own genius for management

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T22:31:41.149390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-06T22:31:40.416807Z digest=sha256:7fc930b6c5104e941221c4f5d6643ba402c48c5c7bf99d1bcd0dbd4d947f8a14

Pith citing papers

Observation e2a8aeb6-0d71-470b-aa72-6e671db70eb7 · inbound

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning cites this paper.

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning Data Efficacy for Language Model Training

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-07-04T13:49:52.415420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-26T04:49:28.598430Z digest=sha256:4f041849ed968e2ffa1fc268be5861d0df84692a35136c3b765fc294a75ee9f6