Pith. sign in

Paper Citation Record · LEDGER

RedPajama: an Open Dataset for Training Large Language Models

As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2411.12372.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.12372 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 22 of 22 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 22 of 22 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:27:57.542454Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

18
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 2faa9b3a-7af2-45e2-becb-87d3f888bdad · inbound

Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging cites this paper.

Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging RedPajama: an Open Dataset for Training Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T14:27:57.542454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T14:27:57.542454Z digest=sha256:4d81c44b98445f691a3e4deeec07e6eef25f09d682434cdc61d836fce509745d

Observation 935cca9e-f840-4481-bfcd-ea0a1f113379 · inbound

A Lightweight Method to Disrupt Memorized Sequences in LLM cites this paper.

A Lightweight Method to Disrupt Memorized Sequences in LLM RedPajama: an Open Dataset for Training Large Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-08T20:08:57.500140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T20:08:57.500140Z digest=sha256:8b8f28d4b55aa0b23fc72736ffbe1a033431628371c7fba680a4898a597bd29f

Observation e48a6e5c-c83a-4769-a84a-670bd1d3bd6b · inbound

EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models cites this paper.

EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models RedPajama: an Open Dataset for Training Large Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-08T14:48:53.827249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T14:48:53.827249Z digest=sha256:4d655f77f3f76d14bbb72090f56ca98571228856098e45cf7cb56e0f8a9a75ff

Observation 4824c5f2-d689-44d9-b29b-4d9ac1db0003 · inbound

Diagnosing our datasets: How does my language model learn clinical information? cites this paper.

Diagnosing our datasets: How does my language model learn clinical information? RedPajama: an Open Dataset for Training Large Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:29:09.304268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:29:09.304268Z digest=sha256:baebd010380e560ac8880069cff23510f88e2b59a8fef45d96294eb9ef64e6f2

Observation e15629f2-7a49-41eb-85b5-df5ef3621fc5 · inbound

Hardware-Efficient Attention for Fast Decoding cites this paper.

Hardware-Efficient Attention for Fast Decoding RedPajama: an Open Dataset for Training Large Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T13:32:33.391740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T13:32:33.391740Z digest=sha256:e01f9d728ee9c3576318b02a28b3fe7a7d1ba01a3b34c873811158bd69997ecd

Observation 37b1cbea-2d9b-41f2-a510-3b6ce62ca490 · inbound

The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text cites this paper.

The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text RedPajama: an Open Dataset for Training Large Language Models

Reference 196

Resolution
unresolved
no resolver link, observed 2026-08-07T10:29:45.444268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:29:45.444268Z digest=sha256:c5024c57ea6401395e8cfa91e207a0324c8b19aa4b3266011729ade85ec12a75

Observation 2a633f51-b59d-4224-8915-6a1fad4c7ad1 · inbound

Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training cites this paper.

Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training RedPajama: an Open Dataset for Training Large Language Models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T04:19:10.350194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T04:19:10.350194Z digest=sha256:c63b745b8c45c6178bd775b3293e8982b373d55638e6e5eb346dd1984d17b4d5

Observation 566ef656-7006-4020-8388-65edc1ea2007 · inbound

Essential-Web v1.0: 24T tokens of organized web data cites this paper.

Essential-Web v1.0: 24T tokens of organized web data RedPajama: an Open Dataset for Training Large Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T00:24:47.623955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:24:47.623955Z digest=sha256:d8562a02c840b3365dc4efb9652f04f38d30f5caa7840c53d3ab100e0944ac70

Observation e8d4a238-444a-4897-981e-b963eab614df · inbound

Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models cites this paper.

Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models RedPajama: an Open Dataset for Training Large Language Models

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:44:26.591858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-21T23:44:01.953344Z digest=sha256:28cdd64aa441a049a4c723dfc1cf923f89b888ca83141c9ab26862980a742bde

Observation 9bbf3e5f-ac51-4f10-b045-a2f423eafe06 · inbound

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models cites this paper.

OLMoASR: Open Models and Data for Training Robust Speech Recognition Models RedPajama: an Open Dataset for Training Large Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T14:49:35.952702Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:49:35.952702Z digest=sha256:4ef091ed1c29ffd86fc5b2d26cdf2db2ba3f49a847f21e035bf7b13057739ae1

Observation c4457a45-cf0d-497e-b605-89b5accb6f50 · inbound

Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling cites this paper.

Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling RedPajama: an Open Dataset for Training Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T13:24:36.827145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:24:36.827145Z digest=sha256:df5c450618ce36e386b36c8442e0b6d7f49a7f05c52e962fa51ebc3cb3b07722

Observation 98500d58-abc6-4f10-a38d-02f91e33dfbc · inbound

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining cites this paper.

Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining RedPajama: an Open Dataset for Training Large Language Models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-17T04:49:03.027674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-17T04:46:33.641714Z digest=sha256:39fe7c2ece489fc139b0c0a6929f6866d192a22671294b14aaf605234b754227

Observation 6b449b42-ea8b-4d18-969d-63fcdb5c7cf9 · inbound

The Effect of Scripts and Formats on LLM Numeracy cites this paper.

The Effect of Scripts and Formats on LLM Numeracy RedPajama: an Open Dataset for Training Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T08:58:51.336919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T08:58:51.336919Z digest=sha256:30232fe9f32e6d7e180e1019fa367ffe4fd9ee3b41d5f6b57892a6d6dca45fcb

Observation dff2e6a1-fa65-4449-b2f9-f9606e2091bd · inbound

A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data cites this paper.

A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data RedPajama: an Open Dataset for Training Large Language Models

Reference 231

Resolution
unresolved
no resolver link, observed 2026-08-03T08:15:34.574812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T08:15:34.574812Z digest=sha256:9362f7d0cf4d45ed3bf170b39bd3aac83154245798f6c88bd273c837114a7615

Observation 590a810a-bea8-41b1-9df8-106cc74348e1 · inbound

Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings cites this paper.

Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings RedPajama: an Open Dataset for Training Large Language Models

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T17:27:15.427174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T22:01:37.613094Z digest=sha256:4fa1a41958de0d78e9c3ed78e4e4023e9c0b4ad0b5e47c9bb95ce943a10cc380

Observation f10efb69-6579-48cc-bbba-5edf701d6a07 · inbound

Small edits, large models: How Wikipedia advocacy shapes LLM values cites this paper.

Small edits, large models: How Wikipedia advocacy shapes LLM values RedPajama: an Open Dataset for Training Large Language Models

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-07-01T09:05:35.771485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-07-01T09:03:09.977131Z digest=sha256:9a0fe2f8021092222f74c8edbd36985d6622745217fe6d175237dbdde2255de5

Observation 32e897c5-9350-474a-a03d-39cf2adbf4ec · inbound

Small edits, large models: How Wikipedia advocacy shapes LLM values cites this paper.

Small edits, large models: How Wikipedia advocacy shapes LLM values RedPajama: an Open Dataset for Training Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-14T19:23:22.815333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T19:23:22.815333Z digest=sha256:9918f3c52d964bd1cf45a99cb0d12e21296c9f67cf821395d4848dbb533666bb

Observation 9729b55e-f368-4e28-bc2c-9fd2bdb8eb9a · inbound

Narrative-UFET: Narrative Generation for Ultra-Fine Entity Typing cites this paper.

Narrative-UFET: Narrative Generation for Ultra-Fine Entity Typing RedPajama: an Open Dataset for Training Large Language Models

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-07-01T19:06:02.750903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-29T01:14:50.756453Z digest=sha256:d80a6bf5609a117f083191639b6f9bbcda0031ae880b4f16e8d29d600b19097e

Observation 152f7a68-96f4-42be-912d-4711e32a7b26 · inbound

$\text{Log}_\text{b}$Quant: Quantizing Language Models in Logarithmic Space cites this paper.

$\text{Log}_\text{b}$Quant: Quantizing Language Models in Logarithmic Space RedPajama: an Open Dataset for Training Large Language Models

Reference 41

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T12:36:55.872510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-07-02T12:35:58.613973Z digest=sha256:dfd055a8d0fdf9d45297612d151f3e06710c403e5de55e7e244147df28dd11fc

Observation 2a65a684-4ba9-4249-bc4c-5dbb900df86c · inbound

A First-Principles Theory of Slow Thinking and Active Perception cites this paper.

A First-Principles Theory of Slow Thinking and Active Perception RedPajama: an Open Dataset for Training Large Language Models

Reference 167

Resolution
verified exact
local_arxiv, observed 2026-07-10T11:37:03.328504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-07-10T11:32:24.374377Z digest=sha256:42fc0ea8aff4785bc5d6fc0ebf328adf1529588bedf719d7d0cc6d78f5bd5881

Observation 69a6c735-9747-426f-aa56-d90025b34803 · inbound

Libra: Taming Attention Workload Skew in Long-Context LLM Training with Bounded Sequence Pool cites this paper.

Libra: Taming Attention Workload Skew in Long-Context LLM Training with Bounded Sequence Pool RedPajama: an Open Dataset for Training Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T00:03:06.880355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T00:03:06.880355Z digest=sha256:39010677335f5b0fa8d69dcb2589aaed6cbb144085a7ebfe01fde7397043f3d9

Observation 2acd6937-8313-480a-9af2-15d5e44ef445 · inbound

From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference cites this paper.

From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference RedPajama: an Open Dataset for Training Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-31T11:19:36.131568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-31T11:19:36.131568Z digest=sha256:15b280f22144a4053ff904fc3448772822d7b02ce842a52239f196c81ecd18a6