Pith. sign in

Paper Citation Record · LEDGER

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models

As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.07463.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07463 v1

Coverage vector

measured 40 of 40 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:41:14.636513Z

measured 40 of 40 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

40 of 40 outbound references displayed

  • verified exact0
  • verified fuzzy20
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1bb2cb67-650b-4bc9-bbeb-2e6be8b0b00d · outbound

This paper cites Rethinking reflection in pre-training, 2025.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Rethinking reflection in pre-training, 2025

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:15.061372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.508198Z digest=sha256:f3f70bcd787eb0d6d24dfb3ace53ec6ce5fbcc96824b93149e2182f18106b157

Observation ea004250-d416-4924-ade8-c31ed815c17a · outbound

This paper cites COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models COIG-CQIA: Quality is All You Need for Chinese Instruction Fine-tuning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.511955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.511955Z digest=sha256:e2fa4eaa6d3edd08503dfd1813691b730e6d8d99f3b2637f7f1cd4340daa1f69

Observation 761eba16-ca57-421d-bf7b-81fca97c88fa · outbound

This paper cites Careful selection of knowledge to solve open book question answering.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Careful selection of knowledge to solve open book question answering

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:15.052572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.515368Z digest=sha256:c59e4eff15c385080cd1708f416980bf36d58facdfc53f46e01039cad139b176

Observation 5ffeffb1-d8a8-400a-bdcc-4bd59c1a7ac4 · outbound

This paper cites CCI-Data [Data set].

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models CCI-Data [Data set]

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:15.042870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.518445Z digest=sha256:f490be6264450ef7c8a535627bb83883521e6fb44eb0207b4574e173e97bea97

Observation 0db9bfae-f766-41b9-963b-b303ddd72d8b · outbound

This paper cites CCI2-Data [Data set].

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models CCI2-Data [Data set]

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:15.032842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.521642Z digest=sha256:fa05272dd271c52d7982ae676acb80b4d2b9abeef7242c01a8d814cfa39096d6

Observation 821bc742-0f46-4d42-ab6c-093a5f3eb79b · outbound

This paper cites WuDaoCorporaText [Data set].

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models WuDaoCorporaText [Data set]

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:15.022976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.524471Z digest=sha256:b0be11921f62d34d5508555ab82cad02ba9c41f679b4e2bcdab1904e051c7f06

Observation a77e3deb-fb75-4756-be2c-09d6d7bc5a95 · outbound

This paper cites Piqa: Reasoning about physical commonsense in natural language, 2019.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Piqa: Reasoning about physical commonsense in natural language, 2019

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.527577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.527577Z digest=sha256:ef1b90490974eb8b83d4ffd4b72e25fd49faee83bf723f5b9a3f3baa5cbbe157

Observation c76ddd3f-3f49-4c0c-bd78-aa2c8867756a · outbound

This paper cites an unresolved cited work.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:41:15.007881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.530537Z digest=sha256:901b2520046d26cafbebf6c124506ecaed63dfd59c1651b354f72e33836e8861

Observation eb896623-f4b0-4fca-92b1-f8139b77609c · outbound

This paper cites Data- juicer: A one-stop data processing system for large language models.Companion of the 2024 International Conference on Management of Data, 2023.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Data- juicer: A one-stop data processing system for large language models.Companion of the 2024 International Conference on Management of Data, 2023

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.999494Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.533269Z digest=sha256:ab74ae331cd3fcaae9296f6d5fa0bdcbee45840cbe1ade2314902929bc200080

Observation 6016aaf2-4ce7-44a1-a002-f5a9d56d1b65 · outbound

This paper cites Chinesewebtext: Large-scale high-quality chinese web text extracted with effective evaluation model, 2023.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Chinesewebtext: Large-scale high-quality chinese web text extracted with effective evaluation model, 2023

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.990030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.536439Z digest=sha256:99e6ef70d30a3978e94857c54148345059a3e80fa67a181e9df5b331674de549

Observation 1b0e76a6-13b4-4204-baec-7bb14c2f216c · outbound

This paper cites Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.539286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.539286Z digest=sha256:709e13b881c85e817efd8627c446ec26476f1b06e035e01cee3e0e3de2bca3e0

Observation 2e138668-d626-46a3-9a64-3ba295c84ae2 · outbound

This paper cites Unsupervised Cross-lingual Representation Learning at Scale.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Unsupervised Cross-lingual Representation Learning at Scale

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.542023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.542023Z digest=sha256:99cce2f82499f1bf32f894ec881e0395ba6442cc3b306611c353fe2c1c73fa55

Observation 0d71b92f-79bb-419f-ae51-fcffb048db63 · outbound

This paper cites Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.975953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.545952Z digest=sha256:11795f601dfc4f67ffc122f49a1ef00b5fd69b1ff2659ed715205819bddedcc8

Observation 61725105-411f-4f92-a3ee-38d037407545 · outbound

This paper cites Lighteval: A lightweight framework for llm evaluation, 2023.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Lighteval: A lightweight framework for llm evaluation, 2023

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.965967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.549699Z digest=sha256:7524b9d2c7ecbcb4a564526b0eb21134aaad551eb6e0de5a7459a756add0f557

Observation 491272bb-96a7-46ad-990d-94452d443c50 · outbound

This paper cites Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.552614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.552614Z digest=sha256:39d3a0c1058bf4ce8223ac75fc40c7c3644ef88ccb75415f0eb19fc854f354e0

Observation eedb7d1d-8808-4cc4-afce-714e6be0fb58 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.555798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.555798Z digest=sha256:10c8c678f0df7c654110f9c324ad651d0fe1310e9543b7a5cef02ff6cc790a73

Observation 568e34bd-b5b9-4742-a8e1-d580cb3dea04 · outbound

This paper cites Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models, 2023.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models, 2023

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.956085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.559100Z digest=sha256:d487a7e18776a55029924f67fddf4fe204e557b121bc0afda2d71d062004bb3a

Observation 124c3a16-07df-4d3c-9311-ab3121e7cefe · outbound

This paper cites Measuring massive multitask language understanding, 2021.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Measuring massive multitask language understanding, 2021

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.562041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.562041Z digest=sha256:4b8f5733af439cf5e2e4bd82fb721e4f97b79083ea917897c20ef80e58ece8e6

Observation 21ec9a21-6c4c-414c-a150-2e4b90653a8e · outbound

This paper cites C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.565274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.565274Z digest=sha256:73a17aa9e742b231db150400f64110ce44eb45a43fac389002d643f326df3c6a

Observation 8a95f47b-695d-4749-9c5a-66e148574b86 · outbound

This paper cites Bag of Tricks for Efficient Text Classification.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Bag of Tricks for Efficient Text Classification

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.568240Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.568240Z digest=sha256:e6cb2f48c392f58a690b605c2f06bf37b8bd29fa3fa80066c71ea36839be4f53

Observation 3d10ba18-7116-4154-add2-7ca26760cf8e · outbound

This paper cites Deduplicating training data makes language models better, 2022.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Deduplicating training data makes language models better, 2022

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.571434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.571434Z digest=sha256:2c2a51ec1d4457eaada48ac8f4db5ea6346254daf495dda8c1eb3ec19ec6ee54

Observation adeb30bd-1aff-4068-a773-356b85376e54 · outbound

This paper cites Levesque, Ernest Davis, and Leora Morgenstern.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Levesque, Ernest Davis, and Leora Morgenstern

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.930480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.574169Z digest=sha256:960369ef934699afeaed9c75133ceddf61707dd1f38c334ce81a3ca835832a29

Observation f4787769-6224-46fb-bbf7-6ecd8ae82858 · outbound

This paper cites Cmmlu: Measuring massive multitask language understanding in chinese, 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Cmmlu: Measuring massive multitask language understanding in chinese, 2024

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.921385Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.577122Z digest=sha256:5df517a22fe020faabb3e8d66dbb2b09fed8a466965ade7ae280f5d28d1b75d5

Observation eecd1c91-24f1-4d04-af7c-e816aa38a308 · outbound

This paper cites Datacomp-lm: In search of the next generation of training sets for language models, 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Datacomp-lm: In search of the next generation of training sets for language models, 2024

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.912583Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.579822Z digest=sha256:bc03e433a596ac031ecc16282a4ae7f416b8c251cc578549b4f3cb9ee24cd637

Observation 5a40faad-a015-4d50-b153-f5e2fc448e83 · outbound

This paper cites Openhermes 2.5-zh: A partial chinese translation of openhermes-2.5, 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Openhermes 2.5-zh: A partial chinese translation of openhermes-2.5, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.903381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.582561Z digest=sha256:233b0a4bf53fffc0effc836079b75b32e04b2bda472d09bb8236f68e7ffbd4b5

Observation f80f6c1e-32d9-412a-82e4-9f296db90657 · outbound

This paper cites Fineweb2: A sparkling update with 1000s of languages, December 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Fineweb2: A sparkling update with 1000s of languages, December 2024

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.894325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.585479Z digest=sha256:f26b268de612f285b0f50548fa9fed5a7932252db2e80ce97efe162640b282f6

Observation 170dd499-10b3-44f6-a796-c6a1bb4bd353 · outbound

This paper cites The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.588446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.588446Z digest=sha256:f51eba2d72790b2a542476f6f87b3b163f18ade948262fe604cef1a38d4cd636

Observation ec09a55b-c1db-4934-9655-83e2df2b2ec1 · outbound

This paper cites Deduplicate Text Datasets.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Deduplicate Text Datasets

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.884898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.592064Z digest=sha256:2091ee6e4616571c113e3a7e805cf9134422937b33d8dc176100c2c26baf4524

Observation 0bee756a-db61-495c-b69a-e91352b8ca2b · outbound

This paper cites Socialiqa: Com- monsense reasoning about social interactions, 2019.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Socialiqa: Com- monsense reasoning about social interactions, 2019

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.596279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.596279Z digest=sha256:c21bcd8a243f7b656e88eec195efd7eb041b85d1a716fd33e4bd630eb540df3a

Observation edbe1d46-58dd-4497-939c-f4d2edd9d3f6 · outbound

This paper cites Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.600683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.600683Z digest=sha256:011765309003a4afb1c18b781ba5678fadbf7adc7f81ffcbf9b44dbf2c8e5101

Observation ae53137f-0530-4d27-a82b-da4d9d9ba88d · outbound

This paper cites Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2024

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.788616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.604175Z digest=sha256:24af8b1b393916b74d433369b3766a0b2343320e211264d6dcb88ade7a8a1473

Observation d4c02cd1-5746-45b0-9ac3-8b0cc7ddabc6 · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.610652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.610652Z digest=sha256:ae987e54ad81e56988d619e8391bb64a07de21eefb08c45d21aa4960b032be42

Observation 5ff8f4b7-0c07-4cd2-83bb-0dc2b5b4905b · outbound

This paper cites Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.613803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.613803Z digest=sha256:a9b64c64dd96ed6a2d33838c7213f2e9aefb795117b1741f029e9155ccbad6ce

Observation 62abf318-fd8f-4daf-bd0b-cb4e3abf1b12 · outbound

This paper cites Qwen2.5: A party of foundation models, September 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Qwen2.5: A party of foundation models, September 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.616833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.616833Z digest=sha256:59f72e75c6433d3ac60de2065eb20c4856919a929c1571233ab544be5a990f65

Observation bfb42c5d-8ef1-4ffb-a744-bcb6f04f7312 · outbound

This paper cites Cci3.0-hq: a large-scale chinese dataset of high quality designed for pre-training large language models, 2024.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Cci3.0-hq: a large-scale chinese dataset of high quality designed for pre-training large language models, 2024

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.773012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.619787Z digest=sha256:4482dacb47bce9a30664fa802cb6108b327647f34535c1f076d8a27bf50b6f97

Observation ee8c4ba0-2457-4119-97b4-aa53e8736227 · outbound

This paper cites Qwen2 Technical Report.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Qwen2 Technical Report

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.622934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.622934Z digest=sha256:992a39f549dcdd4f8b3a13fc100de5c3edb945edb9cb3f550a81d3c982388f49

Observation fec69a07-0e43-46e1-91ea-2e38f3306176 · outbound

This paper cites Opencsg chinese corpus: A series of high-quality chinese datasets for llm training, 2025.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Opencsg chinese corpus: A series of high-quality chinese datasets for llm training, 2025

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.763329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.626461Z digest=sha256:177fa733567c97bd72cf5ff006f5876abfe53b1a5c7bc8d7c45953627b703cd7

Observation 094a470d-2194-4559-bdd4-ab9441d562f3 · outbound

This paper cites Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:14.629752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:41:14.629752Z digest=sha256:dda6700c86ebf8fc2b0cc0716ab222acb557f2dd3a2cb47b41056fed2ffe6317

Observation 730a1797-7f91-41a9-a855-48e534836ef8 · outbound

This paper cites Games" and.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Games" and

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:41:14.753261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.633110Z digest=sha256:3c02a36c2454f027f153d18013db0dcddb56aa57c8d83eca863df1b11dc3830b

Observation 02d8a56d-45ad-4bdd-ac3c-98ac11d90f2d · outbound

This paper cites an unresolved cited work.

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:41:14.743827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-07T05:41:14.636513Z digest=sha256:2e03132d8c8a18807d24519cfbb5a43720a879b4dc6f9725fea12dc5cdc3e236

Pith citing papers

No inbound Pith citation observations are available.