Pith. sign in

Paper Citation Record · LEDGER

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models

As of 20 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2506.07731.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07731 v1

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:34:24.301890Z

measured 54 of 54 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

54 of 54 outbound references displayed

  • verified exact0
  • verified fuzzy21
  • unresolved33
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 95e80969-1d94-45df-8bf0-4334f80bc952 · outbound

This paper cites The Llama 3 Herd of Models.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models The Llama 3 Herd of Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:23.984243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:23.984243Z digest=sha256:b0b31aee0c03a902e83af0d1b2a97d36f065392a6f941390ee35b0ae6b6f69ba

Observation 91fdd820-2027-4d60-96ff-0f045e4af147 · outbound

This paper cites Qwen2.5 Technical Report.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Qwen2.5 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:23.992896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:23.992896Z digest=sha256:330cf50d22dbca48b06a243ac596192e685f45b846e11cdcfea82c82bb832195

Observation 7951fad2-7143-48e8-a759-05cbf3e6fc03 · outbound

This paper cites Falcon2-11B Technical Report.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Falcon2-11B Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:23.997962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:23.997962Z digest=sha256:c76c1e75578d763918c573af883d160aec88ded591de6af60e355de9ceb9b3ef

Observation 0b345c9a-2afe-4fba-8302-c587dec33ebd · outbound

This paper cites A Survey of Large Language Models.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models A Survey of Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.004198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.004198Z digest=sha256:7f8e3c4f08183a9863fd58524740b8589af29d2314bcd6e92e249148c5720992

Observation b05157fc-a886-4ca6-8c9f-3703de78beb9 · outbound

This paper cites HellaSwag: Can a Machine Really Finish Your Sentence?.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models HellaSwag: Can a Machine Really Finish Your Sentence?

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.014052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.014052Z digest=sha256:328ff5940c437dc654a00ece264d5eacff4d0367d3057d3abef7c73cfa717ba3

Observation f1e551fb-b465-41af-92c3-d963a481847b · outbound

This paper cites Winogrande: An adversarial winograd schema challenge at scale.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Winogrande: An adversarial winograd schema challenge at scale

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.022620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.022620Z digest=sha256:5b55cd93e1688dd4da6dd43726be08c076dfbdce2873818ca5afcd397ce22a23

Observation 6fdd2bbe-bd98-4434-aa8f-bb9622febac3 · outbound

This paper cites Measuring massive multitask language understanding.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Measuring massive multitask language understanding

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.028614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.028614Z digest=sha256:94028334a5ea5df1040885fdebc05a879d3826c651bc859ef8e6563f0d64679e

Observation 8d1f35d8-1ee2-4ebb-a52a-11869d87a5b0 · outbound

This paper cites Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Mmlu-pro: A more robust and challenging multi-task language understanding benchmark

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.034078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.034078Z digest=sha256:e9854347ba9a6df9d8bfc4c7e21f4e87244eb82a33c547fc5e7d3ff4ed3bc2eb

Observation 6e8fa017-751c-4f4c-95c6-8e98ed6dc1ef · outbound

This paper cites Gpqa: A graduate-level google-proof q&a benchmark.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Gpqa: A graduate-level google-proof q&a benchmark

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.039242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.039242Z digest=sha256:1fa473cb72d657ffa3150bb4d8cfb274a8ee915376c4b6411da3836ea767a8f8

Observation 344ce59a-6fd8-40d4-b415-f2f574edc337 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Training Verifiers to Solve Math Word Problems

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.045210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.045210Z digest=sha256:706620010cdcddf686e30fb6ba1f3912d1e14aee17a7719ed314b5699236526d

Observation 4572fc88-9d5e-4b5d-95cc-74cb531ba2ae · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.051314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.051314Z digest=sha256:d7fddfa2ca9cdcbe0f3d987f9f050a1d327fbc4177ff8cbbddd3d568a584a85e

Observation ffb23c3c-4554-42f2-9141-b0ec61f7c258 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.056180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.056180Z digest=sha256:a23be9c1752f99ae3425fcc8f6b40908161a1a9d77645958eb4adea777982f70

Observation 53bbafaf-a6e2-4903-92fa-a0c8564ca637 · outbound

This paper cites What is the Role of Small Models in the LLM Era: A Survey.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models What is the Role of Small Models in the LLM Era: A Survey

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.061669Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.061669Z digest=sha256:4e16d256d695b32353a75aa0c4f9c8dd5dc7eb9f75275244a59418b0f9e0e5a2

Observation 52abb96c-b5eb-434a-a4a2-e9fb7259ebac · outbound

This paper cites Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.066290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.066290Z digest=sha256:f133951a3945576fcd2ae7d870da081644fdf69dd3a77b5abfd71ddb221260c7

Observation 4bfc5bee-5f46-407c-a886-a0599802c537 · outbound

This paper cites OLMoE: Open Mixture-of-Experts Language Models.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models OLMoE: Open Mixture-of-Experts Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.071553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.071553Z digest=sha256:963dfc70d900e0e27ba6fe7db44eb15314252885536995f095fb470638091775

Observation eec567c6-c754-4ab4-8baa-31b7459185dc · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.078048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.078048Z digest=sha256:2a1c7c02ae5130be575906ab3164d77ca8da592738e6ffa4dd5f65f4e2841ac0

Observation f1f48485-dae5-4d48-abad-457f907e18e4 · outbound

This paper cites Liu, and Matt Gardner.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Liu, and Matt Gardner

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.224858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.084085Z digest=sha256:9bd6a4035fb0a74ce0f76b18d07d01b9624431875ff069812948718b9ed31fb2

Observation 67010805-7da1-477f-b792-654e356efed1 · outbound

This paper cites Toward an Evaluation Science for Generative AI Systems.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Toward an Evaluation Science for Generative AI Systems

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.091055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.091055Z digest=sha256:c4d2f68b4a1bdd2a30efb91ba83bce5fe3aa9c3024722bcd936cdbe0ee0b2a35

Observation adb9d9d7-c967-4860-a65b-ae619bb15522 · outbound

This paper cites Efficient Large Language Models: A Survey.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Efficient Large Language Models: A Survey

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.096831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.096831Z digest=sha256:afd4a608a5f2e173ec28f5a52024a502ef0a2d605d2f0bdfb5d6fb17d08a3f34

Observation 3870a5ef-4ab3-4d4e-a946-e1d41744f0c6 · outbound

This paper cites Scaling Laws for Neural Language Models.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Scaling Laws for Neural Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.102112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.102112Z digest=sha256:b48cdad060dfcf78ecc06f99eebe464c2a1b9fd6a99e675f31028f0f895b48ad

Observation 9151034a-1c74-4880-a784-ddef281cfe68 · outbound

This paper cites Training Compute-Optimal Large Language Models.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Training Compute-Optimal Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.109130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.109130Z digest=sha256:94abba21544ec0055966ba34bc21ae07dd4b6515be771770ee46dd61658f724a

Observation e23300a7-7e69-4026-b516-7132558fa918 · outbound

This paper cites A survey on large language models: Applications, challenges, limitations, and practical usage.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models A survey on large language models: Applications, challenges, limitations, and practical usage

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.206335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.114220Z digest=sha256:58173af5d1ca9aad5843efb49eb5fbce6a887de42b69a5e862d018c5dd5a39b6

Observation a53c502c-186c-4836-a1b7-3b8763c440c6 · outbound

This paper cites Llm merging: Building llms efficiently through merging.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Llm merging: Building llms efficiently through merging

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.176953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.121140Z digest=sha256:e58374a80878e2f802ae8ef06c9c0a4f6a435f82750d2ac1d31a14ea5df462e7

Observation 3e6fed67-cb35-49a5-b64d-64ef0cb9b366 · outbound

This paper cites Edge-llms: Edge-device large language model competition.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Edge-llms: Edge-device large language model competition

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.160833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.127633Z digest=sha256:73f18d223ff2a052c0c78c7e9b3cfbb0beacaeb3cea84f31456f61825f375bd3

Observation b96889db-bc37-443d-bd61-e9e03ada860c · outbound

This paper cites https://llm-efficiency- challenge.github.io/, 2024.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models https://llm-efficiency- challenge.github.io/, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.144009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.132668Z digest=sha256:41983b3b7d733af55c114e8e5ad5cbb193fffd762d8e970ddddeabcb059c4c7a

Observation ed11da27-2811-4ce5-89ed-3a19ce82a889 · outbound

This paper cites Stages and individual differences in cognitive development.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Stages and individual differences in cognitive development

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.126634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.138720Z digest=sha256:97e483d924f7b4942b0c742f6feda744cf6c9397153e83c337ff110c90760392

Observation dd9d1bbc-a117-46dc-ae91-cd14e863b6ed · outbound

This paper cites The new taxonomy of educational objectives.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models The new taxonomy of educational objectives

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.108424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.143330Z digest=sha256:78a3d6cc86d76cfdd6462ee85fc142b9740fe9b394d2e3e9130a1bcdc8deec72

Observation 84d14a56-b06c-4121-b867-d78a700c5d94 · outbound

This paper cites Taxonomy ofeducational objectives the clas- sification ofeducational goals.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Taxonomy ofeducational objectives the clas- sification ofeducational goals

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.090701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.148367Z digest=sha256:95fe1e332627e9a818b1cd5ce9517632ad6e9147405a0107e0ef3485c5e877f3

Observation 54c502d6-2abc-499a-9973-f1f726de7ec0 · outbound

This paper cites The fineweb datasets: Decanting the web for the finest text data at scale.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models The fineweb datasets: Decanting the web for the finest text data at scale

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.074261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.153351Z digest=sha256:34dd9c4a8f78313bd357f2506e47ad3650bd001cc52da9000fa534cc5ec6f192

Observation 43967017-ed14-46a0-ad3d-c0459a6db40e · outbound

This paper cites Fineweb-edu: the finest collection of educational content, 2024.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Fineweb-edu: the finest collection of educational content, 2024

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.158211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.158211Z digest=sha256:c9102bc6ef99a5ef4e86705382b8c184178fe24ac5cb5e79114d3d4923702ef1

Observation f3c32860-37fb-444a-804c-f831236b37e9 · outbound

This paper cites The stack: 3 tb of permissively licensed source code.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models The stack: 3 tb of permissively licensed source code

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.041996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.162413Z digest=sha256:a8480f50765a58cca5d77bdd5582013f3541766e0d0076563518a1cc6b5b0246

Observation 23d2bf85-5658-4171-845f-89efdaab09d4 · outbound

This paper cites Starcoder 2 and the stack v2: The next generation, 2024.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Starcoder 2 and the stack v2: The next generation, 2024

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.026555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.166800Z digest=sha256:a6e10d362d17496b747f493975c3c060508056f8b7c1e8e94f004a050dcb2a7c

Observation d79a0753-0b9e-4eac-9394-85654265dbe5 · outbound

This paper cites Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning, 2024.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning, 2024

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:25.007656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.171460Z digest=sha256:d48999626deab271195cd6283080f942362df31406f7dccd12554a2b3f828fad

Observation 997b618d-957d-4123-a691-13e7afbd9a01 · outbound

This paper cites an unresolved cited work.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.176655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.176655Z digest=sha256:9a7c23a6392290bf0905e617f1030e89f0d949dd90e387893aad963a5430deee

Observation 3da28a5b-baa0-4e81-9e21-65db149cc632 · outbound

This paper cites Physics of Language Models: Part 3.1, Knowledge Storage and Extraction.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Physics of Language Models: Part 3.1, Knowledge Storage and Extraction

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.181884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.181884Z digest=sha256:f0c6802a38ffa1c1c737d2dbd698d16122e8ef9ddaa62766060e718b54c00ba1

Observation a66c55f8-e0fe-4544-8742-5198e6cc34d2 · outbound

This paper cites an unresolved cited work.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:34:24.965512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.186580Z digest=sha256:a81b1f21e728b685ee79f86f4c933ddf5fc04d684fd5023cd568dcce4d576e55

Observation 19f8f75e-e5fa-4486-aec8-96599f6670a7 · outbound

This paper cites Finetasks: Finding signal in a haystack of 200+ multilingual tasks.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Finetasks: Finding signal in a haystack of 200+ multilingual tasks

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.939950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.191296Z digest=sha256:5eed12d8a6931f397285c0416f6dc0006856c072192a0af5854e666f1954122e

Observation 97c02f2b-3666-44f4-a5c3-9e03237df4ea · outbound

This paper cites Codabench: Flexible, easy-to-use, and reproducible meta-benchmark platform.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Codabench: Flexible, easy-to-use, and reproducible meta-benchmark platform

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.923167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.197272Z digest=sha256:625a4fbb3ca90cf2326d9558c4b3075a1fe6b20f56ec9055eac83ec145f9ba0b

Observation d8777a78-7700-4dc6-b742-6ad439ae53ea · outbound

This paper cites The LAMBADA dataset: Word prediction requiring a broad discourse context.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models The LAMBADA dataset: Word prediction requiring a broad discourse context

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.902662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.202089Z digest=sha256:3d0cacbaf7e914ef4f27a325ff5865b5d5331d7aaaf091f37375d6cc3dfb7c4c

Observation 3f422071-bfc0-44b8-8b57-3febe9296ab5 · outbound

This paper cites Piqa: Reasoning about physical commonsense in natural language.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Piqa: Reasoning about physical commonsense in natural language

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.207281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.207281Z digest=sha256:5e336df34c14bcabedc353c91064cca0750a6d336cdf31d1364e2548dbdabec4

Observation cde405fe-40ec-434a-93fc-9eb8df6c4de5 · outbound

This paper cites Instruction-following evaluation for large language models, 2023.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Instruction-following evaluation for large language models, 2023

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.214911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.214911Z digest=sha256:9593bd50e1734d5fecbc64df3ae2de796b0b48a68f406b5b60098829e4e28575

Observation 6a9663b7-dbfa-41a9-ba14-678b57f0f707 · outbound

This paper cites RACE: Large-scale ReAding comprehension dataset from examinations.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models RACE: Large-scale ReAding comprehension dataset from examinations

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.860995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.221983Z digest=sha256:5c791b6b76180f7e3246ef58fdfcaee1ceb4c8c2c80b45e09b25e8ecdde3af03

Observation 4dc3f492-4861-45ce-8153-8d1086f0a9b0 · outbound

This paper cites Semantic parsing on Freebase from question-answer pairs.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Semantic parsing on Freebase from question-answer pairs

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.834804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.232363Z digest=sha256:91a0ba817f6b671ee4936ccb2437611c4602ca8bcab3ecdc74167865c3421dbd

Observation 63f10966-727f-4796-b79a-122ff02a3f14 · outbound

This paper cites Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.238587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.238587Z digest=sha256:0a08bf942acf4101de3c2f3da001ea0792be400cd75de12e7630a9d00cf80cdc

Observation 54ca9199-39f0-4c6b-8df8-ae5f61b43f84 · outbound

This paper cites DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.247418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.247418Z digest=sha256:d204c9152b6481b39a899125f93b827a9979fa6a63ff15f28d6bd126b6c16a2f

Observation 7bff9da3-0843-4fb2-a6f5-b26d72e9d769 · outbound

This paper cites Boolq: Exploring the surprising difficulty of natural yes/no questions.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Boolq: Exploring the surprising difficulty of natural yes/no questions

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.252788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.252788Z digest=sha256:986866ca74ad085ab20a5105a134dadcb1f7dba1240e94c42b47e90cbfbb13b4

Observation e4f64901-3ebc-44c7-8dfe-19f6722f4711 · outbound

This paper cites Adversarial nli: A new benchmark for natural language understanding.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Adversarial nli: A new benchmark for natural language understanding

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.793555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.258088Z digest=sha256:3187caaa27ae619d14478c423267fad3b41bfa285e96f7638daa8cbde31f1c77

Observation e3940417-37d4-48e3-b1cd-6776893ee0d6 · outbound

This paper cites TruthfulQA: Measuring How Models Mimic Human Falsehoods.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models TruthfulQA: Measuring How Models Mimic Human Falsehoods

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T05:34:24.263191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:34:24.263191Z digest=sha256:e7ac41327da1193f58373bf86ed6c68e239d9fc437ab77dbcdac191e1442e6ac

Observation b6a31d19-0550-468b-a7ec-bf06c35be34f · outbound

This paper cites Mask R-CNN.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Mask R-CNN

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.770431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.268127Z digest=sha256:df385bfd9fa94c082f609cfeadea7c8be9e0ee478db5c9d4eae7f43e7d2e415f

Observation 4cdcbf4b-16f7-489a-b5f5-182b4571eea9 · outbound

This paper cites 26 Figure 8: Validation loss across different datasets for two model variants: Scientific-DataMix (blue) and webOnly-Data (red).

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models 26 Figure 8: Validation loss across different datasets for two model variants: Scientific-DataMix (blue) and webOnly-Data (red)

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.732017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.279906Z digest=sha256:96d37c53c81a6d8583706cf3c2561ce08e9d36cd0e1e372e225eb9c72065e23e

Observation 5f8a63bd-5263-46f2-97e0-305c3ee1c572 · outbound

This paper cites Lower loss on one dataset does not necessarily translate to higher capability on corresponding benchmarks.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Lower loss on one dataset does not necessarily translate to higher capability on corresponding benchmarks

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:34:24.713641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.286413Z digest=sha256:ebe0160670e6aedb8b76f4330f015256c70512556340a7cbabfba00f010d526c

Observation b7d0f763-0cae-400e-8500-32697d552b51 · outbound

This paper cites an unresolved cited work.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:34:24.695601Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.292490Z digest=sha256:0867cbbc1bebf4d81693db137c78526db537ab73389ade88dc24df142344a78f

Observation 8169890c-602a-4ab6-a869-f4992a17611c · outbound

This paper cites an unresolved cited work.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:34:24.676646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.301890Z digest=sha256:40c5d422cb6644c697212c8a6d95e8818f6cf9dafc6cd49b06b9a8edb1d92b1c

Observation 8e7be798-6258-4d8b-aba3-98392e39ca8a · outbound

This paper cites an unresolved cited work.

NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models Unresolved cited work

Reference 2013

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:34:24.751830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:34:24.274048Z digest=sha256:005156a3a916af747b26a8b0ab832e9299274c7951262d4c46aeb94b4e0ffbb2

Pith citing papers

No inbound Pith citation observations are available.