Pith. sign in

Paper Citation Record · LEDGER

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

As of 14 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2502.01697.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01697 v3

Coverage vector

measured 47 of 47 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T17:09:15.462034Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:08:04.002985Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-06T01:00:08.633531Z

Reference resolution

47 of 47 outbound references displayed

  • verified exact1
  • verified fuzzy7
  • unresolved38
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 544ba400-4f9c-4b3f-b138-ba2ac1574724 · outbound

This paper cites On the Diversity of Synthetic Data and its Impact on Training Large Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation On the Diversity of Synthetic Data and its Impact on Training Large Language Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.239770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.239770Z digest=sha256:80fa211a6849f941059447f496e0e68fb56fdc051ee581e72d8b6fa0727f19ba

Observation 9033d16f-0fe9-4637-94c7-25a5e003a62f · outbound

This paper cites Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.245871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.245871Z digest=sha256:89bd768be8a9ac0d6d423a79e70b078c4064e6732e232b12e83d22aa572e7127

Observation bb01b4c7-0fed-4fb4-bd8b-dbe4d0233021 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Training Verifiers to Solve Math Word Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.250957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.250957Z digest=sha256:ba16bd8654c4b9a345f36f3f66287d616ec15601762f2656549cf177e6e8b922

Observation 24d7c184-272a-40fc-858f-7dae6a35eeda · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.255560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.255560Z digest=sha256:53021fdf95dd1d3978d3e793b265b29d476cd6949d74821de6e6dffaaaf7e57a

Observation e5a00fd3-c0a0-4d6f-a07f-4750fa924888 · outbound

This paper cites The Llama 3 herd of models, 2024.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The Llama 3 herd of models, 2024

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.294389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.259953Z digest=sha256:f27338d9dc137959f635227ddae60dbda4f35d5a0772cdcfff9855b483fc88be

Observation ad28d8ab-fa0d-4b12-8341-b38925a23fed · outbound

This paper cites Personas with Attitudes: Controlling LLMs for Diverse Data Annotation.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Personas with Attitudes: Controlling LLMs for Diverse Data Annotation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.264507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.264507Z digest=sha256:72ffa0b70065769498e2ba3c3de6b287a6708f2768606b552f22afcccfcce2d1

Observation b145b221-3dee-488f-b0c7-06e3d27e9764 · outbound

This paper cites Deliberative Alignment: Reasoning Enables Safer Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Deliberative Alignment: Reasoning Enables Safer Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.269623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.269623Z digest=sha256:78880274f229183611e14ea1a61861a595c45099771c7a8e94e19ab740cbc2c9

Observation 37eb2a8b-404a-474b-905c-900182f7e63c · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.274159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.274159Z digest=sha256:97aba0a2fbf5e83210b5633b9e89dc850303db507b632c56e2d06fa0c369dc60

Observation 9e073b28-c120-49c2-aa09-604ca23051cc · outbound

This paper cites The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.278911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.278911Z digest=sha256:968092c7e1586a3c8b4b270ac6e04d5749b98580b00480b0ceef39c68ac6c058

Observation a5e414c0-d1da-46b2-8451-bef6e24ef5dc · outbound

This paper cites The curious case of neural text degeneration.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The curious case of neural text degeneration

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.284177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.284177Z digest=sha256:e085c2d6414e07db35e97036e31d7eaa085cc8a44452b1e9b6330be3462c7c76

Observation 4d6b588a-b842-4ea3-bfaa-87aab0bce7c8 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation LoRA: Low-Rank Adaptation of Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.288860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.288860Z digest=sha256:6a3436c99561202876ccec60b1780c12f947137e9f6a20f416d592286ea688f4

Observation 4021880c-bfe8-40aa-bc00-681ce0271200 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.293263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.293263Z digest=sha256:360068e127b0f93086c427a749a47f579d20223a7c1fc0fae8696ef2258bbbe1

Observation e6fd6502-d8c3-4308-9d3f-57d2a29e0332 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.297509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.297509Z digest=sha256:aeb8cfc65518df2744feb3a1f9a53bc153c6a64e5e505e84a564574de01758be

Observation 392b8dae-7dae-4db8-aeb6-7a8b287be89b · outbound

This paper cites The Enron corpus: A new dataset for email classification research.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation The Enron corpus: A new dataset for email classification research

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.301817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.301817Z digest=sha256:8eedc5fe47766116b10a6f91081dcc429361e7c2ee5d408a523f5761769b462b

Observation e49c82fa-5d36-4c6f-9fad-c2d9e64c57ef · outbound

This paper cites Self-Directed Synthetic Dialogues and Revisions Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Self-Directed Synthetic Dialogues and Revisions Technical Report

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-09T17:09:15.985928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.306173Z digest=sha256:a05a79545cbdf31ecd6683b25e733c2c876c097efa02a67933541d79a7d1bd49

Observation 7eb51fd3-ac6b-4258-a53e-044a59a13164 · outbound

This paper cites Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.310446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.310446Z digest=sha256:3caa849d9e185ff042d42dc6937427397d9288d6b759c8d0e99a9af30c9994a3

Observation 25b28f9f-fb3a-4572-a1ac-311991002502 · outbound

This paper cites Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.314869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.314869Z digest=sha256:139c554a81ba554520655d826b7360b65b9f9209a19c5b50448bee7230acd25c

Observation c7ff898d-718f-439d-ab05-dd5b082f5231 · outbound

This paper cites Making Large Language Models Better Reasoners with Step-Aware Verifier.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Making Large Language Models Better Reasoners with Step-Aware Verifier

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.320000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.320000Z digest=sha256:86b29ab4f2637488ab730f71d44273b378c012fef333376d66f01848c44d9466

Observation 780c2aa7-08c0-4728-b188-dc22d8566f4a · outbound

This paper cites Textbooks Are All You Need II: phi-1.5 technical report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Textbooks Are All You Need II: phi-1.5 technical report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.324762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.324762Z digest=sha256:63dac69c15efd61a2e76056675ef2f54fed06bfbaac206702605cd0866514f21

Observation 68491292-2250-48ad-85d4-02cb81a42492 · outbound

This paper cites Best Practices and Lessons Learned on Synthetic Data.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Best Practices and Lessons Learned on Synthetic Data

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.329025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.329025Z digest=sha256:d0bca0c3fef11559b8f4af4da827a8914a4941b21d1528c8be3c8556d56bcc8f

Observation e4375cc6-08b8-4683-b337-991ab3ce7c6b · outbound

This paper cites Diversity of Thought Improves Reasoning Abilities of LLMs.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Diversity of Thought Improves Reasoning Abilities of LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.333815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.333815Z digest=sha256:050b2e86f96d46c5604903f40fd80dbec1dc7a88d3791ff34cdb84c1be1b8e32

Observation 24cc36f4-ac9e-4e94-8c2a-fc5985da2af2 · outbound

This paper cites Sky-T1 : Train your own o1 preview model within \ 450.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Sky-T1 : Train your own o1 preview model within \ 450

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.266824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.338662Z digest=sha256:99ff11a3f124a0f9b37368c270df2986982e888f100ea81c21baec92b59a158c

Observation 901ea479-15ff-4e3d-a9d6-3cb78658daa8 · outbound

This paper cites Nemotron-4 340B Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Nemotron-4 340B Technical Report

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.343666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.343666Z digest=sha256:5152d06dac32e2dc597c76c50b4a74ab070478003d1ed7b7f37dd6454c40d70a

Observation a951b623-fa39-456d-99ed-afa5f09e158f · outbound

This paper cites New embedding models and API updates.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation New embedding models and API updates

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.250040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.348335Z digest=sha256:b2322568501d47f96dc106f25bee31ee401501747e836c0cad5e8347a19f30c6

Observation 0b2b5582-e43e-4314-889f-02f31a2cb24c · outbound

This paper cites GPT-4 Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation GPT-4 Technical Report

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.352761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.352761Z digest=sha256:8aca48ab2a6e8342087154fbdb8cdc0317edc3a09e2ef8c936aa716d55e45e41

Observation 827297e9-ae7d-4882-9975-e36474e612a6 · outbound

This paper cites Hello GPT -4o.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Hello GPT -4o

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.234816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.359249Z digest=sha256:1f24a17ac605c4a96de256564901ea85850e616bb252a3616f249ce1cef61587

Observation 5c76823b-3c36-44d4-8269-757774240fb5 · outbound

This paper cites Gorilla: Large Language Model Connected with Massive APIs.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Gorilla: Large Language Model Connected with Massive APIs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.364141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.364141Z digest=sha256:565ecffca2c091e08f4bfade71d5bd637f12056109bfcf4620ba051c3f888cea

Observation 458081d4-843f-437b-b421-c7102a78779a · outbound

This paper cites Pedregosa, G.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Pedregosa, G

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.218064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.369308Z digest=sha256:bd7bcc62d5579f9ebd4f0665ff114a1c79d23146dc92e1a9e3019a1e5070e9ce

Observation 702d81d7-265a-4afb-81ee-802c9b5735a3 · outbound

This paper cites Qwen2.5 Technical Report.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Qwen2.5 Technical Report

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.374631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.374631Z digest=sha256:189fcdd8324d825710546521d98bde85a066870b5489f142a1645ee7b40fcb3a

Observation e102adaa-4e9b-4eef-9476-d01d69925c11 · outbound

This paper cites Pretraining task diversity and the emergence of non-Bayesian in-context learning for regression.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Pretraining task diversity and the emergence of non-Bayesian in-context learning for regression

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.379020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.379020Z digest=sha256:b3a190299d31ac9c913ab2e0fcaa1de465436542b4e50b2ecab056625f67d309

Observation 68c2e63d-4415-4c43-a7e9-74e78600ec98 · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.383592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.383592Z digest=sha256:cca75e622bd7fa9f3e97a83c9b2c0aa7b06df6714a9de8aacb2b049eb5720781

Observation 6ffe84fd-eaf0-4e13-921e-e69b834f062a · outbound

This paper cites Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.388084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.388084Z digest=sha256:2c95b52c5d3510abab0ea5357509d934e3b268eabcb278b11fa25cb33427a9aa

Observation 586ef5b8-853c-436a-a23a-623cdbf75e23 · outbound

This paper cites LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.392584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.392584Z digest=sha256:2149dd54c33e4de30c5f9145e034ec06c182982b8cc0bb878ba03a8201535beb

Observation 938fd7e5-380d-415a-809f-0ed018152fb8 · outbound

This paper cites an unresolved cited work.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.397214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.397214Z digest=sha256:8c9d914054869bda4ccf78270660df8110753c37186ed543fda64ae6f64ceb38

Observation 024b5d0b-e28d-42cb-90e1-4cdb6fe1978f · outbound

This paper cites Evaluating the evaluation of diversity in natural language generation.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Evaluating the evaluation of diversity in natural language generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.401643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.401643Z digest=sha256:ba97204766a17c7f6e71542b5460b8e8333d869a8ec63823b69563eaea60b951

Observation 99900fa9-792c-4c23-ad14-0f4202cec919 · outbound

This paper cites Will we run out of data? Limits of LLM scaling based on human-generated data.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Will we run out of data? Limits of LLM scaling based on human-generated data

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.405937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.405937Z digest=sha256:cd5fe8ef733da8732003bb23d764602978feaf6e6383224836b9a81a43b04444

Observation b9803525-502c-4b40-9174-1a87d9228f96 · outbound

This paper cites Planning In Natural Language Improves LLM Search For Code Generation.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Planning In Natural Language Improves LLM Search For Code Generation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.410799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.410799Z digest=sha256:cc6f1e8a1b03e3d558046c384a1fa41b81e59ac13c773f310d6db9c1f19351c3

Observation 0d142431-7588-4070-b671-6d039be6ea62 · outbound

This paper cites Magicoder: Empowering code generation with OSS -instruct.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Magicoder: Empowering code generation with OSS -instruct

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.200570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.415817Z digest=sha256:60243a5dd9af5b05b03b9ca761b5d97343fcdf10c40e309cac62925fdfcc2627

Observation 104c2e8a-7e1c-4db3-bac6-5a96f0ca35e9 · outbound

This paper cites SimpleStrat: Diversifying Language Model Generation with Stratification.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation SimpleStrat: Diversifying Language Model Generation with Stratification

Reference 39

Resolution
metadata mismatch
local_arxiv, observed 2026-08-09T17:09:15.657418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.420749Z digest=sha256:c670df2b8676a33cad8e210e6304802db8841f4c0eeb6f0bbc67c43670d8dd91

Observation 2ea13239-fe82-4ffe-836b-95c6ff8c16f1 · outbound

This paper cites HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.425105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.425105Z digest=sha256:998afe81ac9334b1b4bf32a50006c7a64edbc02d5b4afe1afd8505cba9f1ec02

Observation 78e7e278-1efe-4c4b-ae27-20f3223f0a22 · outbound

This paper cites MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.430065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.430065Z digest=sha256:4e212551cd8654933ea0a61a7369ab78ac91defddb71c31c625c2e6a3bdec962

Observation 0e410b0d-eb4e-495a-828c-567b648cb6d6 · outbound

This paper cites STaR: Bootstrapping Reasoning With Reasoning.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation STaR: Bootstrapping Reasoning With Reasoning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.435280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.435280Z digest=sha256:eb80a410eaa8a8593f1052dc9a6db2c8badcc8ca5986fdf9dc7de0f357a04360

Observation 8ea1cc25-cc61-439b-a26e-3aa6baf3a731 · outbound

This paper cites Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.440023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.440023Z digest=sha256:f0356d78caac957ef7bbd3559032b3e4b0b09da608be77bb31cba36670644ca7

Observation 27b82581-9b8d-42d7-8ffd-de5e7d5c7ad4 · outbound

This paper cites Improving diversity of commonsense generation by large language models via in-context learning.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Improving diversity of commonsense generation by large language models via in-context learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.445251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.445251Z digest=sha256:0d9d733d845362e39af6811b51aa9420cec35d3241337d6c48c8b9e417cd45b9

Observation df241338-3eb9-43d3-ac69-82ad2f9c04cd · outbound

This paper cites RAFT: Adapting Language Model to Domain Specific RAG.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation RAFT: Adapting Language Model to Domain Specific RAG

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.450446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.450446Z digest=sha256:fb5c48a4fa8fb13c388db4bb724837271bc8107bb1c35fcb1c10d11d150ff2ff

Observation 371d0bbb-e1fa-437c-bc2c-84d4e7773a69 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation BERTScore: Evaluating Text Generation with BERT

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T17:09:15.456381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:09:15.456381Z digest=sha256:58a0f68ea42a809524042fcdf8f8992c0cc0b583745c0cb92d89eeff99a262a0

Observation efe1d1fb-afc7-4ee2-a5b4-5d47bcfc09c7 · outbound

This paper cites Texygen: A benchmarking platform for text generation models.

BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation Texygen: A benchmarking platform for text generation models

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:09:16.184992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-09T17:09:15.462034Z digest=sha256:4069e1aa6e66e5c7058ce473a12d5011d2fd6be183532bc5ce69612fc7b1b735

Pith citing papers

Observation 5eac65fc-499a-4ab9-ae64-4d2af8ab00bd · inbound

LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions cites this paper.

LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-07T15:08:04.002985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:08:04.002985Z digest=sha256:53703214426b2fed1310461d59208c990640c208d3267bbcdbf4e62851649b90

Observation 2989eccf-5992-4b4d-b8ae-743be62803b9 · inbound

The Prompt is Mightier than the Example cites this paper.

The Prompt is Mightier than the Example BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:34:11.865218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:34:11.865218Z digest=sha256:61c9eb2a406feb259cd362efb334ae367c907ed257f75b787289fabbca2dfb74

Observation ec2af6cb-b8cc-468b-98ec-7dafcabab294 · inbound

Intent Factored Generation: Unleashing the Diversity in Your Language Model cites this paper.

Intent Factored Generation: Unleashing the Diversity in Your Language Model BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T04:47:42.438433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T04:47:42.438433Z digest=sha256:669ae1dfd92881ccab4813e34008e79d5ed4f727dd110627fda5936f84a0949b

Observation 7d61fdd7-b584-44bd-9dde-c07de86117bf · inbound

Fine-tuning for Better Few Shot Prompting: An Empirical Comparison for Short Answer Grading cites this paper.

Fine-tuning for Better Few Shot Prompting: An Empirical Comparison for Short Answer Grading BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-06T01:00:08.723033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T01:00:07.506842Z digest=sha256:880bcf1430a14a2f7e20e61b6bd655343ce0331feffa0c83df63d13805ddeed0