Pith. sign in

Paper Citation Record · LEDGER

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

As of 14 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2502.01697.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01697 v3

Coverage vector

measured 47 of 47 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T17:09:15.462034Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:08:04.002985Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-06T01:00:08.633531Z

Reference resolution

47 of 47 outbound references displayed

  • verified exact1
  • verified fuzzy7
  • unresolved38
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 544ba400-4f9c-4b3f-b138-ba2ac1574724 · outbound

This paper cites On the Diversity of Synthetic Data and its Impact on Training Large Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation On the Diversity of Synthetic Data and its Impact on Training Large Language Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.239770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.239770Z digest=sha256:16a23e34fbc54ca92053a30a7db5f3a63c1117e2e6292cd2424aaf3a2b14437c

Observation 9033d16f-0fe9-4637-94c7-25a5e003a62f · outbound

This paper cites Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.245871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.245871Z digest=sha256:a17294987ec435cb9f1921d9cc32f8d6a7ac1f92bbd49eb3ec67a18e60c96e6b

Observation bb01b4c7-0fed-4fb4-bd8b-dbe4d0233021 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Training Verifiers to Solve Math Word Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.250957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.250957Z digest=sha256:e8763741adbf0629d997d79f37ccc806b999380380e87d4b7158e35f0f5fb536

Observation 24d7c184-272a-40fc-858f-7dae6a35eeda · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.255560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.255560Z digest=sha256:704d0a8e1d5937d92db40e4a175148440b685a63fac8095ae9a6bfbf1e522075

Observation e5a00fd3-c0a0-4d6f-a07f-4750fa924888 · outbound

This paper cites The Llama 3 herd of models, 2024.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The Llama 3 herd of models, 2024

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.294389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.259953Z digest=sha256:ba8dce96a2a60ce718e286bc865deafe0c779dd954d77abf09fcc7d155543b4a

Observation ad28d8ab-fa0d-4b12-8341-b38925a23fed · outbound

This paper cites Personas with Attitudes: Controlling LLMs for Diverse Data Annotation.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Personas with Attitudes: Controlling LLMs for Diverse Data Annotation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.264507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.264507Z digest=sha256:e0db5f307915c609494d23ac7adc04271aee2508b3e8edbb7b256c109d1c6068

Observation b145b221-3dee-488f-b0c7-06e3d27e9764 · outbound

This paper cites Deliberative Alignment: Reasoning Enables Safer Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Deliberative Alignment: Reasoning Enables Safer Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.269623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.269623Z digest=sha256:4adaaac21d6b2873603372cd2d489fd6f292c6f30fe80bb58d36e8c8baca2f3e

Observation 37eb2a8b-404a-474b-905c-900182f7e63c · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.274159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.274159Z digest=sha256:55f5d7125c12fa6ce0cfe281cc82bdbe4a28200e887c7aafe2b3294aa62a0e08

Observation 9e073b28-c120-49c2-aa09-604ca23051cc · outbound

This paper cites The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.278911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.278911Z digest=sha256:c253015cdbc9709af8f7fc11aa2f36d7b073b34962a64da601f4397347e254ad

Observation a5e414c0-d1da-46b2-8451-bef6e24ef5dc · outbound

This paper cites The curious case of neural text degeneration.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The curious case of neural text degeneration

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.284177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.284177Z digest=sha256:69baa9e6cc3e7a7af68f7f83d813b87be6c2f11b7e3809d9e98d89784b6da5d0

Observation 4d6b588a-b842-4ea3-bfaa-87aab0bce7c8 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation LoRA: Low-Rank Adaptation of Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.288860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.288860Z digest=sha256:d955f9665aa1642dbfcee40f8bb1df3899e2632600f10f560a7d3f90f0092434

Observation 4021880c-bfe8-40aa-bc00-681ce0271200 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.293263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.293263Z digest=sha256:a53321ce26453d95812ceba59590b018011e7a350aabd9d471f8aa5ae06629aa

Observation e6fd6502-d8c3-4308-9d3f-57d2a29e0332 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.297509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.297509Z digest=sha256:7db622474a1c222c506d3ce417196a32eadd67ef160fc6f375ea7647707b55f7

Observation 392b8dae-7dae-4db8-aeb6-7a8b287be89b · outbound

This paper cites The Enron corpus: A new dataset for email classification research.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The Enron corpus: A new dataset for email classification research

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.301817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.301817Z digest=sha256:cfa3c92c0809ff095ed05fafcaeaa08181ef385158ce402758c0323ea58892df

Observation e49c82fa-5d36-4c6f-9fad-c2d9e64c57ef · outbound

This paper cites Self-Directed Synthetic Dialogues and Revisions Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Self-Directed Synthetic Dialogues and Revisions Technical Report

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-09T17:09:15.985928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.306173Z digest=sha256:4664aef108b126022330eff5c2c815c5a329fd9019d981413147c18eff339893

Observation 7eb51fd3-ac6b-4258-a53e-044a59a13164 · outbound

This paper cites Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.310446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.310446Z digest=sha256:b4874d9ee9b6ad0528d82e2fa10b95d9b543ec8b0765849e6f509b753984e637

Observation 25b28f9f-fb3a-4572-a1ac-311991002502 · outbound

This paper cites Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.314869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.314869Z digest=sha256:9677e30d8c843df9b4731ca6596ea1773703971471736378605be67655de63f1

Observation c7ff898d-718f-439d-ab05-dd5b082f5231 · outbound

This paper cites Making Large Language Models Better Reasoners with Step-Aware Verifier.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Making Large Language Models Better Reasoners with Step-Aware Verifier

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.320000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.320000Z digest=sha256:ff4adb5ef6a8b391399e9963c1b166beefcfc8fec612f6fd66316fedd5f988bc

Observation 780c2aa7-08c0-4728-b188-dc22d8566f4a · outbound

This paper cites Textbooks Are All You Need II: phi-1.5 technical report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Textbooks Are All You Need II: phi-1.5 technical report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.324762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.324762Z digest=sha256:fbbee0613a2890174242c2e5fdd4029ad84956bbf55eb532864daced10900e7c

Observation 68491292-2250-48ad-85d4-02cb81a42492 · outbound

This paper cites Best Practices and Lessons Learned on Synthetic Data.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Best Practices and Lessons Learned on Synthetic Data

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.329025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.329025Z digest=sha256:37f85ca9f7b207d67f6922581f2c2bd5ca615e6cf08129ebb30ca8d1359d848b

Observation e4375cc6-08b8-4683-b337-991ab3ce7c6b · outbound

This paper cites Diversity of Thought Improves Reasoning Abilities of LLMs.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Diversity of Thought Improves Reasoning Abilities of LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.333815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.333815Z digest=sha256:5cf30d2b54fbc39877938229e9be2b98dd280a4947ad4b8bf6274ec37b14a3b3

Observation 24cc36f4-ac9e-4e94-8c2a-fc5985da2af2 · outbound

This paper cites Sky-T1 : Train your own o1 preview model within \ 450.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Sky-T1 : Train your own o1 preview model within \ 450

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.266824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.338662Z digest=sha256:45a1dd4d406cb2dd9a5e311208d675dff7041eab6b16320c0c8a810471e29a5b

Observation 901ea479-15ff-4e3d-a9d6-3cb78658daa8 · outbound

This paper cites Nemotron-4 340B Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Nemotron-4 340B Technical Report

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.343666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.343666Z digest=sha256:c8a10f35e17c09f54c6e1baa18dcaa57a14ded3427db088840b81b8853a1e124

Observation a951b623-fa39-456d-99ed-afa5f09e158f · outbound

This paper cites New embedding models and API updates.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation New embedding models and API updates

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.250040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.348335Z digest=sha256:275fc371981abfbde9c9f6475c388bd581a912ff3530d2fc51e3860fd941c277

Observation 0b2b5582-e43e-4314-889f-02f31a2cb24c · outbound

This paper cites GPT-4 Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation GPT-4 Technical Report

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.352761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.352761Z digest=sha256:a2119882a09c4ae6907d905fd6473750320f2ed93af92a592a17a198d1951036

Observation 827297e9-ae7d-4882-9975-e36474e612a6 · outbound

This paper cites Hello GPT -4o.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Hello GPT -4o

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.234816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.359249Z digest=sha256:6137864ecca707a977d758c27262ca3be130f2d50aeba44f4764f6ed0dfb9241

Observation 5c76823b-3c36-44d4-8269-757774240fb5 · outbound

This paper cites Gorilla: Large Language Model Connected with Massive APIs.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Gorilla: Large Language Model Connected with Massive APIs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.364141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.364141Z digest=sha256:2233a084e1700fde4a9d034c9a6ee2f165a252e5cf35e5c8f27a44dad3305892

Observation 458081d4-843f-437b-b421-c7102a78779a · outbound

This paper cites Pedregosa, G.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Pedregosa, G

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.218064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.369308Z digest=sha256:7a9abb5c6f9a6c98a0acda53dfc40d46f169e3cea9772659216e6d5ab95f063b

Observation 702d81d7-265a-4afb-81ee-802c9b5735a3 · outbound

This paper cites Qwen2.5 Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Qwen2.5 Technical Report

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.374631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.374631Z digest=sha256:6b79ce15dea6ed58c919764fc01b841f4602d194cddcdb48a86f6ad07e2c08f4

Observation e102adaa-4e9b-4eef-9476-d01d69925c11 · outbound

This paper cites Pretraining task diversity and the emergence of non-Bayesian in-context learning for regression.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Pretraining task diversity and the emergence of non-Bayesian in-context learning for regression

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.379020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.379020Z digest=sha256:88eb4ecdc0e854510c0bf30f2ff1b53057ae8d84a9c7399f8dd8e43fbb27fba0

Observation 68c2e63d-4415-4c43-a7e9-74e78600ec98 · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.383592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.383592Z digest=sha256:7b1be91b410103c24f7eb4a3c52cfd1d268e7b91e24c376d56f46ae4a5ac360f

Observation 6ffe84fd-eaf0-4e13-921e-e69b834f062a · outbound

This paper cites Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.388084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.388084Z digest=sha256:a152c8b7c42e77b982dc6ae8156219a31e586b1ea534804404bb41bf8bcb98cf

Observation 586ef5b8-853c-436a-a23a-623cdbf75e23 · outbound

This paper cites LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.392584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.392584Z digest=sha256:0cd8a4d1d3f796d76d885e3f876d49a71083d75c4003bbee903db09e2bcccd06

Observation 938fd7e5-380d-415a-809f-0ed018152fb8 · outbound

This paper cites an unresolved cited work.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.397214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.397214Z digest=sha256:05ab24ff7d3965685796cb24090a5d6a63b3db9b1043944e4e49f87af233edbb

Observation 024b5d0b-e28d-42cb-90e1-4cdb6fe1978f · outbound

This paper cites Evaluating the evaluation of diversity in natural language generation.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Evaluating the evaluation of diversity in natural language generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.401643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.401643Z digest=sha256:4a2af296ffe31977a89d7b08688ce808794dd510677b2690e3224595f8f73a07

Observation 99900fa9-792c-4c23-ad14-0f4202cec919 · outbound

This paper cites Will we run out of data? Limits of LLM scaling based on human-generated data.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Will we run out of data? Limits of LLM scaling based on human-generated data

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.405937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.405937Z digest=sha256:0f7d79cdf76a49a2a4fa3a983239ff0310718d90ac016e9e38442edcdf6840ac

Observation b9803525-502c-4b40-9174-1a87d9228f96 · outbound

This paper cites Planning In Natural Language Improves LLM Search For Code Generation.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Planning In Natural Language Improves LLM Search For Code Generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.410799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.410799Z digest=sha256:11bf7b57dd001d0a2cc4f181364a9ed3f28e3c0247e56d5b9bdba1a44d84314d

Observation 0d142431-7588-4070-b671-6d039be6ea62 · outbound

This paper cites Magicoder: Empowering code generation with OSS -instruct.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Magicoder: Empowering code generation with OSS -instruct

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.200570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.415817Z digest=sha256:224f189655ec1ed3e6383ca8c0ed80f45d11882d11dfdb57490e047c027eaf86

Observation 104c2e8a-7e1c-4db3-bac6-5a96f0ca35e9 · outbound

This paper cites SimpleStrat: Diversifying Language Model Generation with Stratification.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation SimpleStrat: Diversifying Language Model Generation with Stratification

Reference 39

Resolution
metadata mismatch
local_arxiv, observed 2026-08-09T17:09:15.657418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.420749Z digest=sha256:fb3071ad8d15f3a06b0847fa49b2c1c0d819659b3a01ea9e43bfba71b86b3e63

Observation 2ea13239-fe82-4ffe-836b-95c6ff8c16f1 · outbound

This paper cites HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.425105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.425105Z digest=sha256:6db0dc3a3e25d3ae9ccf953d4e3ca96c347fea84b208a05fcaa93d333ed4b779

Observation 78e7e278-1efe-4c4b-ae27-20f3223f0a22 · outbound

This paper cites MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.430065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.430065Z digest=sha256:82fa55c9592ea2d3373fb524b2aef19a6fc9cc93518ded63eb38bdae8914c62f

Observation 0e410b0d-eb4e-495a-828c-567b648cb6d6 · outbound

This paper cites STaR: Bootstrapping Reasoning With Reasoning.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation STaR: Bootstrapping Reasoning With Reasoning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.435280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.435280Z digest=sha256:6269a5570159532afd53327af3d3c97523443d82e3c256ead909f122ec1e003f

Observation 8ea1cc25-cc61-439b-a26e-3aa6baf3a731 · outbound

This paper cites Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.440023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.440023Z digest=sha256:f4f13af4ef55dd892322d8cb5dedabb9ee97519e4fdfa3f3a863a9955be904fc

Observation 27b82581-9b8d-42d7-8ffd-de5e7d5c7ad4 · outbound

This paper cites Improving diversity of commonsense generation by large language models via in-context learning.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Improving diversity of commonsense generation by large language models via in-context learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.445251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.445251Z digest=sha256:8aa1280ae4c03c018053b90eb80c5c3ee7db142a8e24e08fc4e8a5f12df18142

Observation df241338-3eb9-43d3-ac69-82ad2f9c04cd · outbound

This paper cites RAFT: Adapting Language Model to Domain Specific RAG.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation RAFT: Adapting Language Model to Domain Specific RAG

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.450446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.450446Z digest=sha256:86c3dd657fca5e69baa908aef6bee258fe00b1d3b0df8bbd5ef5b7ac885db5b3

Observation 371d0bbb-e1fa-437c-bc2c-84d4e7773a69 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation BERTScore: Evaluating Text Generation with BERT

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.456381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.456381Z digest=sha256:5d0ca6a7d6dbc85a41e23abdd5eb6dbbd1d8625d5c1f279e3bc34af24f4fe089

Observation efe1d1fb-afc7-4ee2-a5b4-5d47bcfc09c7 · outbound

This paper cites Texygen: A benchmarking platform for text generation models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Texygen: A benchmarking platform for text generation models

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.184992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.462034Z digest=sha256:448a8eb9ab1ca8511b251a29d730fd9905a2fb2a8e071dc2b826d5af2e2dac42

Pith citing papers

Observation 5eac65fc-499a-4ab9-ae64-4d2af8ab00bd · inbound

LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions cites this paper.

LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-07T15:08:04.002985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:08:04.002985Z digest=sha256:21771b71a682ab2124c35c1d4d23881c259ba362dbf7d730295bb27e5252f7c8

Observation 2989eccf-5992-4b4d-b8ae-743be62803b9 · inbound

The Prompt is Mightier than the Example cites this paper.

The Prompt is Mightier than the Example BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:34:11.865218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:34:11.865218Z digest=sha256:db0929af9b141b9a4fc3847e7bb25619fcf9f0f2549d8f119e11ed6d7538f684

Observation ec2af6cb-b8cc-468b-98ec-7dafcabab294 · inbound

Intent Factored Generation: Unleashing the Diversity in Your Language Model cites this paper.

Intent Factored Generation: Unleashing the Diversity in Your Language Model BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T04:47:42.438433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T04:47:42.438433Z digest=sha256:8215e53369fa7fe2bade5f523007199a67dbdfc2c12b74fd80961c6bca6b5c35

Observation 7d61fdd7-b584-44bd-9dde-c07de86117bf · inbound

Fine-tuning for Better Few Shot Prompting: An Empirical Comparison for Short Answer Grading cites this paper.

Fine-tuning for Better Few Shot Prompting: An Empirical Comparison for Short Answer Grading BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-06T01:00:08.723033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T01:00:07.506842Z digest=sha256:f1168ebc558c7af3c28b5c5efee62f932158bd675892b88da8b13a0fa2e7368d