{"as_of":"2026-08-17T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de3b3bab45908b8837d3710fb5c178e4ae43c9c83127c1e4517f74f933f1dd55","coverage":[{"denominator":135,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:17:55.889322Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:44:04.984553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T22:42:47.026295Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17743","snapshot_observed_at":"2026-08-06T11:44:04.984553Z","title":"Yulan-mini: An open data-efficient language model, dec 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.984553Z"},"links":{"cited_paper":"/paper/2412.17743","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:78202dd851eca8906f9436cf6efc997b7c623831132491e4ae4451ca1cb8d175","observation_id":"0f838f95-5254-4696-9768-1be08b293133","resolution":{"observed_at":"2026-08-06T11:44:04.984553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"cited_work":{"arxiv_id":"2412.17743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17743","snapshot_observed_at":"2026-06-28T22:42:47.026295Z","title":"X., and Wen, J","venue":null,"work_id":"e44fffcf-c836-45bd-bbd5-e8b61f36e825","year":null},"citing_paper":{"arxiv_id":"2605.31175","last_updated":"2026-05-29T11:42:55Z","snapshot_observed_at":"2026-08-15T10:30:10.663273Z","submitted_at":"2026-05-29T11:42:55Z","title":"Towards Efficient LLMs Annealing with Principled Sample Selection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:36:28.889515Z"},"links":{"cited_paper":"/paper/2412.17743","citing_paper":"/paper/2605.31175"},"observation_digest":"sha256:01a0ce7529d9065994679c680ff20dd239695dd355835114aa958500869cb804","observation_id":"bdd60ec4-fc6d-4569-bebe-949dfecc6068","resolution":{"observed_at":"2026-06-28T22:42:47.027667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17743/citation-record","integrity":"/paper/2412.17743/integrity","json":"/paper/2412.17743/citation-record.json","paper":"/paper/2412.17743"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.471132Z","title":"Synthetically generated reasoning dataset (gsm8k-inspired) with enhanced diversity using gretel navigator and meta-llama/meta-llama-3.1-405b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.471132Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a3bea8bcb98737e268940659485c845dbd5c7a3394d620756bb89a012625ba89","observation_id":"df77c6d9-4f40-4203-bedf-43a1607a9ad6","resolution":{"observed_at":"2026-08-11T05:17:55.471132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.476338Z","title":"GQA: training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.476338Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:196fc09039bef8796abbd6c9a8e30602cf0c11fedaf1ee5e72374f81fbc7ccdd","observation_id":"f4218e80-733e-4b6f-b694-44c605f6f83e","resolution":{"observed_at":"2026-08-11T05:17:55.476338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.481319Z","title":"Smollm2 - with great data, comes great performance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.481319Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6df6e402a0f0dc71a73bc056f3c13e3cfd0ccaccef8d273ec9addad4634d6e82","observation_id":"47c0352e-4240-465a-ad63-c8eb4b1d05d6","resolution":{"observed_at":"2026-08-11T05:17:55.481319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-11T05:17:55.485739Z","title":"Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.485739Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:52e7709723c13260f07a33c150a70f622b16b4191eb96088df4768d715908ce8","observation_id":"e37bebbe-739c-44fd-9835-bf0361a23c9a","resolution":{"observed_at":"2026-08-11T05:17:55.485739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.489943Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.489943Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6c520ba2008b0ba516aade703f0c3da10ca0d76c7cd982e7c68b7f151579a2eb","observation_id":"3c185ad2-d8ba-4e5a-8194-27ed0d1b079e","resolution":{"observed_at":"2026-08-11T05:17:55.489943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T05:17:55.493672Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.493672Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:663e6815d3660513a85767d69b59145078bf6d0260d302f4c52d53ecd5cd4c04","observation_id":"e94615bc-fb03-40db-b562-11ac0fae0d5d","resolution":{"observed_at":"2026-08-11T05:17:55.493672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.498666Z","title":"Numinamath 7b cot, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.498666Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f34f9197d6113c442cd70a437f1450885e1aa5d52767b2fcba46adcd123b1af3","observation_id":"0e699dc9-a885-4867-ac49-624da63de074","resolution":{"observed_at":"2026-08-11T05:17:55.498666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-16T14:14:46.903233Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-11T05:17:55.502568Z","title":"Stable LM 2 1.6b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.502568Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:46f5f9836159189e911f75e2febe990f47b9b31b6e21ee8df4c440fa90c42fae","observation_id":"272b80f4-77c6-4adf-a15c-c943b17e1b84","resolution":{"observed_at":"2026-08-11T05:17:55.502568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-11T05:17:55.507213Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.507213Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:9302d0cc68bd78b81359c5584d3da7a78868e13b8abcbdf1c5bf17b388ca6b59","observation_id":"fbf056b8-538a-4826-b382-f64b47e8f88c","resolution":{"observed_at":"2026-08-11T05:17:55.507213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.511890Z","title":"Enriching word vectors with subword information","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.511890Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2fed312afbc61b7ed02ba86a255bbe15a4d6ff0817c94be69c22075a478569fa","observation_id":"95f3bacb-3738-4743-8d1c-e8fc6ca2ccde","resolution":{"observed_at":"2026-08-11T05:17:55.511890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T05:17:55.515998Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.515998Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:083f26408bc5abe7320a998097796b3a7fe5e8a9c7c13ccefed7b1e6ee439a70","observation_id":"02e4b734-3974-4cec-a258-a447529ed422","resolution":{"observed_at":"2026-08-11T05:17:55.515998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18743","last_updated":"2024-07-26T13:55:21Z","snapshot_observed_at":"2026-08-16T13:30:46.667216Z","submitted_at":"2024-07-26T13:55:21Z","title":"Towards Effective and Efficient Continual Pre-training of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18743","snapshot_observed_at":"2026-08-11T05:17:55.520414Z","title":"Towards effective and efficient continual pre-training of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.520414Z"},"links":{"cited_paper":"/paper/2407.18743","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d1b6a6ce55fe500341f650c75b32c4594dc89cfb09cd9c71b5c359390884cf89","observation_id":"9872fc41-c8f6-4414-b6d4-029bdfe30fa2","resolution":{"observed_at":"2026-08-11T05:17:55.520414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T05:17:55.524982Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.524982Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a9927550ad04cd56e5597b941046c7860ce5a43014c1750fdd4b8cdcdac0ca28","observation_id":"b69e5e27-df9c-4063-ac7d-257c56c29113","resolution":{"observed_at":"2026-08-11T05:17:55.524982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-11T05:17:55.529338Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.529338Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:60fbfc8c07bd8c4dea934edee1bf37c1b0a0731689a51e8f62d42fd5a97392ad","observation_id":"e5f94ab0-63e4-4d26-aeb0-e904cbdb294f","resolution":{"observed_at":"2026-08-11T05:17:55.529338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.533625Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.533625Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2fc6467b57a7268790d0829fa2b523c5c8c045445015adb93ae7c4ea39272462","observation_id":"ed4ff887-4d77-4b69-b3f9-260798e02840","resolution":{"observed_at":"2026-08-11T05:17:55.533625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.537912Z","title":"Stable language model pre-training by reducing embedding variability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.537912Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d1a62feff31e35c24559b792066e50c340a121ae8983f104ed9e62d8c22d643a","observation_id":"cb83bf82-f089-408a-ae44-9bd1c40c0646","resolution":{"observed_at":"2026-08-11T05:17:55.537912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T05:17:55.542009Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.542009Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:17e8fd4021770bc7494c30a1350697851a534add8aa9bff55018f093d9a47c35","observation_id":"da012ea5-0bc2-42ae-97f6-7f9ba1d720ed","resolution":{"observed_at":"2026-08-11T05:17:55.542009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.546543Z","title":"Getting the most out of your tokenizer for pre-training and domain adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.546543Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6a2207417e01c3a0daaaa0b889066bea1aaa3643205d589ac43550b13cc5cb1d","observation_id":"22b90065-8b4c-4236-b9db-83e8981b7c1d","resolution":{"observed_at":"2026-08-11T05:17:55.546543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.550757Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.550757Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0deac881101a59b952e6e6c3ffd7bcfbec1a97c34b21bba986a23a5dec533769","observation_id":"fba000f4-a138-4d21-aa15-c521de1ca8e9","resolution":{"observed_at":"2026-08-11T05:17:55.550757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.554907Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\' e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.554907Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:69c9c5fe5880717b17ba2968743c4d8cf52335c9b498a4d997a226f6933a583b","observation_id":"bbf71baf-c53e-483b-8904-4493fbe45e2e","resolution":{"observed_at":"2026-08-11T05:17:55.554907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.08859","last_updated":"2016-05-27T15:17:34Z","snapshot_observed_at":"2026-08-14T21:59:31.458519Z","submitted_at":"2016-04-29T14:53:00Z","title":"The Z-loss: a shift and scale invariant classification loss belonging to the Spherical Family","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.08859","snapshot_observed_at":"2026-08-11T05:17:55.558844Z","title":"The z-loss: a shift and scale invariant classification loss belonging to the spherical family","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.558844Z"},"links":{"cited_paper":"/paper/1604.08859","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:98acecbb7aee7afafade48facb26966a68ada99c6091dce455adee4732cdff2b","observation_id":"30bc93ab-dd92-45a3-970a-41c9f2d2daae","resolution":{"observed_at":"2026-08-11T05:17:55.558844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T05:17:55.563036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.563036Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:1300ad0a47eade3c6f5c5059a75760be6f86ef1f5054c4e545053a1a59d1a020","observation_id":"bc5c1223-b083-41f4-94d7-3c48f1089703","resolution":{"observed_at":"2026-08-11T05:17:55.563036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-08-16T15:42:13.397788Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-11T05:17:55.567673Z","title":"Cerebras-gpt: Open compute-optimal language models trained on the cerebras wafer-scale cluster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.567673Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b489e7f6da02174972c4333a234bfcce90e295d51b60f10ddc306139e8032810","observation_id":"af3b0201-dff7-427d-b99f-80d6287253a9","resolution":{"observed_at":"2026-08-11T05:17:55.567673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-08-16T15:42:13.397788Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-11T05:17:55.572114Z","title":"Cerebras- GPT : Open Compute - Optimal Language Models Trained on the Cerebras Wafer - Scale Cluster , April 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.572114Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d129c4ed82f801da3f55866f628bb1a0de51f8803ee4145d0a5a56e984d3f4e4","observation_id":"ccd84ed2-68ac-41d0-8c31-aacf436a642b","resolution":{"observed_at":"2026-08-11T05:17:55.572114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.576433Z","title":"Fewer truncations improve language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.576433Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:bb93ed9ca85e4fd0a2a5fd377fc14effec4fdce116263e78e7f9cbdefbaa5dc5","observation_id":"36df1169-9b02-4f39-bcb4-79dc5fccd27e","resolution":{"observed_at":"2026-08-11T05:17:55.576433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18693","last_updated":"2025-05-27T11:56:56Z","snapshot_observed_at":"2026-08-16T18:14:06.330642Z","submitted_at":"2024-10-24T12:42:04Z","title":"Unleashing LLM Reasoning Capability via Scalable Question Synthesis from Scratch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18693","snapshot_observed_at":"2026-08-11T05:17:55.581180Z","title":"Unleashing Reasoning Capability of LLMs via Scalable Question Synthesis from Scratch , October 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.581180Z"},"links":{"cited_paper":"/paper/2410.18693","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e5511aa99385d088323e906aa75ed802e4d468cde4fedea8495c4db741e43ed2","observation_id":"22e330f8-59c7-45d4-86a3-afa5ed5e212f","resolution":{"observed_at":"2026-08-11T05:17:55.581180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T05:17:55.585075Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.585075Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:9f816b41dd9200f488858e0d4aa2b0f81317e417622afec7b1e9790c2eff0c65","observation_id":"03f5878e-5136-4877-9845-24c75587f9f5","resolution":{"observed_at":"2026-08-11T05:17:55.585075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.589435Z","title":"How to train long-context language models (effectively)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.589435Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b45db1b8f941bce6b8f66a460010f19dbe2af4a5e85dc2ca243058b1e4f3e99d","observation_id":"b9452567-fcfc-43d5-b05b-1ed6feac7507","resolution":{"observed_at":"2026-08-11T05:17:55.589435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.593442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.593442Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:1e01453a6b8ca1cd9a39bd2f9bd0bdfafd5fe25361fda08a3f3142f8e793e61c","observation_id":"9a6e0d48-8c4e-4080-af5c-01b40a15c30b","resolution":{"observed_at":"2026-08-11T05:17:55.593442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-11T05:17:55.597466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.597466Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d28d5bcd72bc659f81d2fd5a83bd38f984ed6a282eb6e51718989b59203db160","observation_id":"f1605bc3-5fd9-4b9b-b773-7caf82493577","resolution":{"observed_at":"2026-08-11T05:17:55.597466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-08-16T13:48:31.034274Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-11T05:17:55.601448Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.601448Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:47bf40ef1ebf7f82c8a3811d45b9ac94991f993e984bb6d71a261a55b0d63b09","observation_id":"6a403ff7-89b4-4607-92e6-f7666643267d","resolution":{"observed_at":"2026-08-11T05:17:55.601448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12568","last_updated":"2024-09-19T08:41:21Z","snapshot_observed_at":"2026-08-16T13:17:15.224129Z","submitted_at":"2024-09-19T08:41:21Z","title":"InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12568","snapshot_observed_at":"2026-08-11T05:17:55.605726Z","title":"Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.605726Z"},"links":{"cited_paper":"/paper/2409.12568","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:aae53fec6b1d85a955be0b1ab233192861b33adc4443867d17a46709c16c3ecf","observation_id":"2ddbd7f9-26bc-4f36-ac4f-33c67402dd97","resolution":{"observed_at":"2026-08-11T05:17:55.605726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-08-17T13:54:00.101026Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-08-11T05:17:55.610187Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.610187Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:40074c81d2690304e3ceee994c980c6e31e89f187942cc0ee8bd75917fb4c998","observation_id":"63e25bf4-9410-445f-8098-cb5f101cb6e8","resolution":{"observed_at":"2026-08-11T05:17:55.610187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.615373Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.615373Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:831e42cc31774e3a499f6c028b6b76dee325efb4dadb2a77eea28a4d40542c7b","observation_id":"f3b6e776-e0ee-41e8-bbe1-24af0c471084","resolution":{"observed_at":"2026-08-11T05:17:55.615373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.619133Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.619133Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e7173f4cd850d0df34a7277faa6706e912ed3afb2ac45f8b020b623772f924f9","observation_id":"0f9d24a7-59ad-4173-a868-dccd6a75ca9a","resolution":{"observed_at":"2026-08-11T05:17:55.619133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-11T05:17:55.622904Z","title":"RULER: what's the real context size of your long-context language models? CoRR, abs/2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.622904Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0ab6b227c0d5b50784bd013fd5c8a1fc7e67dec6b3506df31023f75ffbac9ce2","observation_id":"3c4af250-12f0-4265-a334-039538d6197e","resolution":{"observed_at":"2026-08-11T05:17:55.622904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-08-16T13:09:27.656495Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-11T05:17:55.627059Z","title":"Liger kernel: Efficient triton kernels for LLM training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.627059Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:05d2b6cc2161478400cdfd95588ef8ede8d95d8ff492796e806b6fffbbce3b7c","observation_id":"4e44f159-f1be-4f96-95af-8b6c3daa637e","resolution":{"observed_at":"2026-08-11T05:17:55.627059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T05:17:55.631254Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.631254Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:3f07e951b22862d0bb79a0bc098fe74d23d767bb4e6c3dba0639e90f440d5563","observation_id":"543551f6-61da-48a3-9c78-d6bea96bef33","resolution":{"observed_at":"2026-08-11T05:17:55.631254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.635377Z","title":"Towards reasoning in large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.635377Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:411502a13081f6c901d5b3f2448962ab8a50fd0aaa444414b108de75dbcae6ab","observation_id":"af6f29f5-c0f0-4490-bdc5-37df4a1b3eae","resolution":{"observed_at":"2026-08-11T05:17:55.635377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-16T13:02:01.818557Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-11T05:17:55.639091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.639091Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:616ea61b31e8a9c1e368c5049d18460bc1a4fbdab7fdb57f91c1b3133c4cd948","observation_id":"fd4a7a7c-209e-4ac8-8610-9380619344df","resolution":{"observed_at":"2026-08-11T05:17:55.639091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.643976Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.643976Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:57593827ea29b468b8e8d1886760f9ab0c6c606ffb16fd0f5e544f8d31b608f5","observation_id":"7b105f39-5c3a-44cd-87fe-c318ad56a07d","resolution":{"observed_at":"2026-08-11T05:17:55.643976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11694","last_updated":"2024-12-31T01:38:12Z","snapshot_observed_at":"2026-08-13T10:27:01.324745Z","submitted_at":"2024-11-18T16:15:17Z","title":"Enhancing LLM Reasoning with Reward-guided Tree Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11694","snapshot_observed_at":"2026-08-11T05:17:55.648063Z","title":"Technical report: Enhancing llm reasoning with reward-guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.648063Z"},"links":{"cited_paper":"/paper/2411.11694","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:968f63b95d95061405bec3afada1027257665ce953902ee837a242271fdc174b","observation_id":"240854d5-6f3e-4d93-b7b2-5728c82054bd","resolution":{"observed_at":"2026-08-11T05:17:55.648063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-17T17:37:20.986921Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-11T05:17:55.652243Z","title":"TinyBERT : Distilling BERT for Natural Language Understanding , October 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.652243Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:b852bf4fae326c4ab7ce497bbb44e428bd7a64f97fbbdea1fc0bb43f7df26cba","observation_id":"7953ac66-43f5-4b25-a25c-99c2f4eace53","resolution":{"observed_at":"2026-08-11T05:17:55.652243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.656023Z","title":"Calc-x and calcformers: Empowering arithmetical chain-of-thought through interaction with symbolic systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.656023Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:81a78cf8464c2525740a77172c20eb200f5a27dd22c8241d66bf5c7486461907","observation_id":"c751306f-b105-4e1b-a7a1-8fda87d4eb45","resolution":{"observed_at":"2026-08-11T05:17:55.656023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.659548Z","title":"Kaplan, Sam McCandlish, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.659548Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:680eee57b0590432eefab83cbb0359277002833617d3a565643e7f46ce1e1ff7","observation_id":"d7630e91-5b85-4337-a9ec-4517ff9cb306","resolution":{"observed_at":"2026-08-11T05:17:55.659548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.361","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:56.533170Z","title":"LAMBADA: backward chaining for automated reasoning in natural language","venue":null,"work_id":"fe9cd672-2e71-437b-bf96-92d0422ca7b7","year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.663382Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:76c5f49cddfbd43f16d19379f699897feccecd62203e92a959e6c25a0f84c036","observation_id":"792d3be0-7377-4567-be23-a8fbd389d9d1","resolution":{"observed_at":"2026-08-11T05:17:56.539446Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07490","last_updated":"2024-05-13T06:09:10Z","snapshot_observed_at":"2026-08-16T13:53:18.024275Z","submitted_at":"2024-05-13T06:09:10Z","title":"Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07490","snapshot_observed_at":"2026-08-11T05:17:55.666929Z","title":"Strategic data ordering: Enhancing large language model performance through curriculum learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.666929Z"},"links":{"cited_paper":"/paper/2405.07490","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:4d5d37f5145a2c1bbb7835dfd1f62b63a503243cdf47e4c5ce1e33926551cd3f","observation_id":"60c94e68-27d2-4cfe-ae69-1de60d8ecccf","resolution":{"observed_at":"2026-08-11T05:17:55.666929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.672190Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.672190Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:da02705aa44adabf4da4664896c303dbb5834d9abd4ed7d5cc2d6f6ffaa9659b","observation_id":"4057b232-8906-43bd-8b28-ad50ea8af76f","resolution":{"observed_at":"2026-08-11T05:17:55.672190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-17T04:35:11.747367Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-11T05:17:55.676267Z","title":"Race: Large-scale reading comprehension dataset from examinations, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.676267Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:5bec8a0fc04c45cfcf68508e55aa40a055ea544e58737b708c2312d10304e67d","observation_id":"1698723c-f8f3-438e-a616-b412cc3819df","resolution":{"observed_at":"2026-08-11T05:17:55.676267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T05:17:55.680324Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.680324Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a00df5974a9b793817a55b9cdd8bba97ee401b3e57901b348a8063e51b04f4b8","observation_id":"3d73b432-089c-424a-ad9f-463f6bf7e903","resolution":{"observed_at":"2026-08-11T05:17:55.680324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18710","last_updated":"2025-03-25T11:11:03Z","snapshot_observed_at":"2026-08-16T13:48:22.704820Z","submitted_at":"2024-05-29T02:42:23Z","title":"To FP8 and Back Again: Quantifying Reduced Precision Effects on LLM Training Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18710","snapshot_observed_at":"2026-08-11T05:17:55.684447Z","title":"To FP8 and back again: Quantifying the effects of reducing precision on LLM training stability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.684447Z"},"links":{"cited_paper":"/paper/2405.18710","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:9b95b6c966012003a32e4697d81526450677bd5267d2f3a032e65335bbde68a7","observation_id":"e1f626a6-a936-45c9-830e-18f7d7523ff6","resolution":{"observed_at":"2026-08-11T05:17:55.684447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.688724Z","title":"The stability-efficiency dilemma: Investigating sequence length warmup for training GPT models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.688724Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:87dba39eae84a0c0bfeb080c6a175f54b1c12bc5d137436270b22f15709e372e","observation_id":"e646169e-494e-4935-aa76-3bc0cb5be7e1","resolution":{"observed_at":"2026-08-11T05:17:55.688724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.692410Z","title":"CMMLU: measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.692410Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2740a1f957f8149fdb17c8267beecbe9ee9430bc6d61e3685535a958d54117c4","observation_id":"ef7c6435-63ab-4922-b7b1-43c270f1fd16","resolution":{"observed_at":"2026-08-11T05:17:55.692410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-11T05:17:55.696737Z","title":"Pratt, Sunny Sanyal, Gabriel Ilharco, Giannis Daras, Kalyani Marathe, Aaron Gokaslan, Jieyu Zhang, Khyathi Raghavi Chandu, Thao Nguyen, Igor Vasiljevic, Sham M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.696737Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:953c0d052877d1979e70119cd511056865c28c245a71d315fa3b06a8ca059bf7","observation_id":"0e8be959-aca8-4043-81cc-e0592cffea2d","resolution":{"observed_at":"2026-08-11T05:17:55.696737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.701333Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.701333Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a98af2320f58cd342f9aae5d287e3b7f84d5655ff74ddc47ba2a74d31cb9d5af","observation_id":"200054d4-573d-4a44-9017-415b27af45b3","resolution":{"observed_at":"2026-08-11T05:17:55.701333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.704949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.704949Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:064cf029776d6756449a7e06abc558ee82763d1ce717b5d0addba90ee369308b","observation_id":"a1ecbb9f-8465-4419-9f0f-fc3cf894a521","resolution":{"observed_at":"2026-08-11T05:17:55.704949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.709214Z","title":"Slimorca: An open dataset of gpt-4 augmented flan reasoning traces, with verification, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.709214Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:64da7d715e1941b70c7b6392b53f2c015b05cbc7af9e08ae0d064feb8b69fead","observation_id":"ab00372e-7f4b-4e68-9899-323b816fbd19","resolution":{"observed_at":"2026-08-11T05:17:55.709214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18820","last_updated":"2025-07-04T06:16:30Z","snapshot_observed_at":"2026-08-16T13:39:15.067940Z","submitted_at":"2024-06-27T01:28:30Z","title":"Universal Checkpointing: A Flexible and Efficient Distributed Checkpointing System for Large-Scale DNN Training with Reconfigurable Parallelis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18820","snapshot_observed_at":"2026-08-11T05:17:55.713062Z","title":"Universal checkpointing: Efficient and flexible checkpointing for large scale distributed training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.713062Z"},"links":{"cited_paper":"/paper/2406.18820","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:3bddaea462bc91dce049867ef79e440e2d42e4a3045fd8d69b05a7cc6fd57889","observation_id":"51016bb6-ed26-4228-8ce7-e2a0cf89d0a7","resolution":{"observed_at":"2026-08-11T05:17:55.713062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.717656Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.717656Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0f22a77536d53574335ee11eca7246246811050f4ff949e3d12ab993882726bf","observation_id":"71a195d8-08d9-429f-856f-f4e36eb3087e","resolution":{"observed_at":"2026-08-11T05:17:55.717656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10040","last_updated":"2025-03-15T12:25:58Z","snapshot_observed_at":"2026-08-16T13:34:27.937520Z","submitted_at":"2024-07-14T01:43:07Z","title":"Lean-STaR: Learning to Interleave Thinking and Proving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10040","snapshot_observed_at":"2026-08-11T05:17:55.721451Z","title":"Lean-star: Learning to interleave thinking and proving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.721451Z"},"links":{"cited_paper":"/paper/2407.10040","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:bdf5f98ad1edbcf85c677e04812c440c3e3933556a12543e930ef350415ac176","observation_id":"1d46ae2a-a2eb-42c1-9a4c-6d00d8b3d451","resolution":{"observed_at":"2026-08-11T05:17:55.721451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.725736Z","title":"Evaluating language models for efficient code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.725736Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:57f82bb2ee3dc5078b827cd75123ef1382871d71f8b26bcd88c519d3b2bd6507","observation_id":"a0730987-ad22-477c-91cb-3dd1f406fe4b","resolution":{"observed_at":"2026-08-11T05:17:55.725736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.729586Z","title":"Longwanjuan: Towards systematic measurement for long text quality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.729586Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e772564e3f23f95788b43096f95fbe063849a7ad96fdb03797e966f8c2458904","observation_id":"332f812f-14f7-49cc-8a0b-bc98b5b1a394","resolution":{"observed_at":"2026-08-11T05:17:55.729586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.733247Z","title":"Iandola, Chen Lai, Yuandong Tian, Igor Fedorov, Yunyang Xiong, Ernie Chang, Yangyang Shi, Raghuraman Krishnamoorthi, Liangzhen Lai, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.733247Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7ff2e7003afd6680a7bf7e97f5b8961213f866d945656f31ee157d36297edfdb","observation_id":"372b526d-e9d4-499b-822f-e2b8c5ae2fc2","resolution":{"observed_at":"2026-08-11T05:17:55.733247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.736619Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.736619Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:39b6c5054dce6f690b747e84ccb29876531b964d8f6ac32a49f54c05325dd065","observation_id":"29198369-d345-492c-8104-5ef371e61085","resolution":{"observed_at":"2026-08-11T05:17:55.736619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.740267Z","title":"Fineweb-edu, May 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.740267Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:abf7d2c6c70e19062d0c3a21d520a691bc667de6c4127cb85b4d3ee8724b8b7b","observation_id":"0a8a1e71-1888-423c-b010-e3f41b4cfb23","resolution":{"observed_at":"2026-08-11T05:17:55.740267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-11T05:17:55.743567Z","title":"McAuley, Han Hu, Torsten Scholak, S \\' e bastien Paquet, Jennifer Robinson, Carolyn Jane Anderson, Nicolas Chapados, and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.743567Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2413e12bcf07d3cb28bfd5748433e98f41d3278ebc2d932b811a009ef6e59b93","observation_id":"ffbab978-eb00-4886-9b1e-9fa502d20b1e","resolution":{"observed_at":"2026-08-11T05:17:55.743567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.747649Z","title":"\\# instag: Instruction tagging for analyzing supervised fine-tuning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.747649Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:fae4f2e1e7abdc6270bbe8e5d893bdad00abe8f67376d5c7d441a21f9fbadedc","observation_id":"e265e353-5c69-4eb7-8f90-70c410304222","resolution":{"observed_at":"2026-08-11T05:17:55.747649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T05:17:55.751805Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.751805Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:26d34bb4924afae08a5e3d8c9937ed7165435976831a8d2a6022a49c39b0fa27","observation_id":"ada51368-6dfe-4c1f-85d8-d15a3b00a4aa","resolution":{"observed_at":"2026-08-11T05:17:55.751805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-08-16T16:04:15.848709Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-11T05:17:55.755485Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.755485Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:89a89e00e2cbb79d5708be1194afae232d00aadd66d0fa4ecaeaa246877c01b4","observation_id":"7682d8df-fb4c-48ac-9114-8ad3e7336eb1","resolution":{"observed_at":"2026-08-11T05:17:55.755485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03502","last_updated":"2024-07-03T21:01:12Z","snapshot_observed_at":"2026-08-16T13:37:14.651237Z","submitted_at":"2024-07-03T21:01:12Z","title":"AgentInstruct: Toward Generative Teaching with Agentic Flows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03502","snapshot_observed_at":"2026-08-11T05:17:55.759885Z","title":"Agentinstruct: Toward generative teaching with agentic flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.759885Z"},"links":{"cited_paper":"/paper/2407.03502","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:21a81b61b4ea2bfec8ff015c1732dc7f5d60aedcb077fbdadcb290b059372c46","observation_id":"2888ad4e-50be-48ba-990a-1fe349f00bc8","resolution":{"observed_at":"2026-08-11T05:17:55.759885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-16T14:17:49.494789Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-11T05:17:55.764251Z","title":"Orca-math: Unlocking the potential of slms in grade school math","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.764251Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6fc3e7d08a525cb927b2b3e7c3eed0addab2d28694246ff6900fdc9d0e96bb6c","observation_id":"20006ad7-ff15-436b-b12c-742bebf742df","resolution":{"observed_at":"2026-08-11T05:17:55.764251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-16T22:51:53.749107Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-11T05:17:55.769456Z","title":"A theory on adam instability in large-scale machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.769456Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:ea948045b675bc28ba0957deb97d82815ed815663ff8ac8fb8eff31c7dc7d36d","observation_id":"c86fb826-818e-46aa-bd8a-a26fc2b0a430","resolution":{"observed_at":"2026-08-11T05:17:55.769456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01696","last_updated":"2016-04-06T17:15:10Z","snapshot_observed_at":"2026-08-15T15:49:48.621156Z","submitted_at":"2016-04-06T17:15:10Z","title":"A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01696","snapshot_observed_at":"2026-08-11T05:17:55.775045Z","title":"A corpus and evaluation framework for deeper understanding of commonsense stories, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.775045Z"},"links":{"cited_paper":"/paper/1604.01696","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:258a9fe2944ab88cf121c2e3813dbe9ea75c5a66d93a001af732533342d6eef0","observation_id":"20a028e5-506a-4f8a-b8b4-3fe06c836d58","resolution":{"observed_at":"2026-08-11T05:17:55.775045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.779633Z","title":"Initialization of large language models via reparameterization to mitigate loss spikes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.779633Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7d8bf973dba447f400e7fd3134e0c5d536bb6a5cc3de633f249995151bf14d7c","observation_id":"37f381ee-a220-45c8-b701-6757e7e54e4d","resolution":{"observed_at":"2026-08-11T05:17:55.779633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T05:17:55.783357Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.783357Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f92d524d6952471fef804f67d3fabf3417b2f5bf08823b8211a10415ca391602","observation_id":"0d427be1-5e49-4c7f-8999-73dec0ad5d7b","resolution":{"observed_at":"2026-08-11T05:17:55.783357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.788805Z","title":"Opencsg/chinese-fineweb-edu Datasets at Hugging Face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.788805Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:6e5dd82426c981d7a0298589a249c29077a6f0938209622c70c1be6665668cd9","observation_id":"1a62bfcc-d9f6-461c-8325-421f6c18c33f","resolution":{"observed_at":"2026-08-11T05:17:55.788805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.793062Z","title":"Openwebmath: An open dataset of high-quality mathematical web text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.793062Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:175c6dcee816ed21cb922c9dbeae8ea423dc820a5d7012dedf114c8f35e56353","observation_id":"4025dfc6-5705-4989-93c8-9e057f581fd7","resolution":{"observed_at":"2026-08-11T05:17:55.793062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-11T05:17:55.796851Z","title":"The FineWeb Datasets : Decanting the Web for the Finest Text Data at Scale , October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.796851Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:32b56f642740c7bde133c5b649fdd0cec17bb5a0eaaa5a63fbe52a5a3a462425","observation_id":"8c045feb-349f-4345-b277-87987db0101a","resolution":{"observed_at":"2026-08-11T05:17:55.796851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.800922Z","title":"Using the output embedding to improve language models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.800922Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:a47e896a942c45f326be3eb5c13469176a0f500eec830fa76a9798b410d07966","observation_id":"b96506b3-2dd9-4ed0-9312-32ccf87930ef","resolution":{"observed_at":"2026-08-11T05:17:55.800922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.805088Z","title":"Bpe-dropout: Simple and effective subword regularization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.805088Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:f8e9f4b483eaeb92cf36b34dc8616642eb238d7240d73f25b71037a88972496d","observation_id":"fb3f90b6-cd61-48ce-88a9-3167d0f6cd56","resolution":{"observed_at":"2026-08-11T05:17:55.805088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.809849Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.809849Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:5ae07ea226f2741ff6555fc241ae37f74ff10de6cac59915d39c1466ac7b4d52","observation_id":"dfd598b5-840e-401e-aea0-b701e6d112d4","resolution":{"observed_at":"2026-08-11T05:17:55.809849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.813910Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.813910Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:d219a9eac75b3c0d363a1fb72ebdd40a6b062612500892f60190ed7e17c2da86","observation_id":"cbb74a3b-c0d6-4000-9465-ace5f2b438af","resolution":{"observed_at":"2026-08-11T05:17:55.813910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-08-14T23:34:44.373057Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-08-11T05:17:55.818112Z","title":"Zero: memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.818112Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:04dff7fa3642c82fff262516c9145606de1048b229310975631ca0242323e550","observation_id":"11a5e7c4-1136-4352-8252-4ef5e130d539","resolution":{"observed_at":"2026-08-11T05:17:55.818112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16682","last_updated":"2024-10-22T04:27:03Z","snapshot_observed_at":"2026-08-16T22:50:50.587216Z","submitted_at":"2024-10-22T04:27:03Z","title":"Methods of improving LLM training stability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16682","snapshot_observed_at":"2026-08-11T05:17:55.822498Z","title":"Methods of improving LLM training stability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.822498Z"},"links":{"cited_paper":"/paper/2410.16682","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:cb73fae5523aeb35ef13b9ca3e1bc6dc22c81c77ddf39142ffe0efa8bc68a426","observation_id":"98d016bd-757e-40a0-bc69-5d86bb7d5913","resolution":{"observed_at":"2026-08-11T05:17:55.822498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.826872Z","title":"Winogrande: an adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.826872Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:faf089e244716b80dcd6fe50767ae8081921c21a34352623f0e0274fa2889c17","observation_id":"15560fa9-2c6a-46c7-85fa-55bd7bea687f","resolution":{"observed_at":"2026-08-11T05:17:55.826872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.830356Z","title":"Analysing mathematical reasoning abilities of neural models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.830356Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:4972d4bd8ab552826c9946b79888c8d495e4b9b646989e2d19aeaa73f076262a","observation_id":"309525be-37af-4878-aa69-f0beef33a369","resolution":{"observed_at":"2026-08-11T05:17:55.830356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15424","last_updated":"2022-11-08T04:56:12Z","snapshot_observed_at":"2026-08-16T16:20:38.834454Z","submitted_at":"2022-10-27T13:43:27Z","title":"What Language Model to Train if You Have One Million GPU Hours?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15424","snapshot_observed_at":"2026-08-11T05:17:55.834003Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.834003Z"},"links":{"cited_paper":"/paper/2210.15424","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2e4ea01ec42d7766606b3d29bb3e3ead4a440ac3b141b3a3931239827093d9bd","observation_id":"dd4fec3b-5f25-4c4d-860d-e6cf23ba19dc","resolution":{"observed_at":"2026-08-11T05:17:55.834003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-11T05:17:55.837609Z","title":"GLU variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.837609Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:780b0dfbdeece1a8b7e303dfe364ad191af6542d85726560d4c82f5082eb7cd6","observation_id":"50587157-1d42-495a-8d07-2e0c299bd7b7","resolution":{"observed_at":"2026-08-11T05:17:55.837609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.841726Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.841726Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7983cad42c75e7afe19cdaed2bc12ed400aca7c61c28eeb7c21e8fbb20bc5b99","observation_id":"8730c3b9-df50-4f55-9cd3-42ff5cae83c1","resolution":{"observed_at":"2026-08-11T05:17:55.841726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T05:17:55.845648Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.845648Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:19de3a355d3d069a25fdacb20ad2977c0ae455d7bcf9cb63e112a26bc8bd96fa","observation_id":"49a2a1f1-c421-43ed-bf83-eeefaf70a699","resolution":{"observed_at":"2026-08-11T05:17:55.845648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.850860Z","title":"Scaling synthetic logical reasoning datasets with context-sensitive declarative grammars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.850860Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:36b056eae9938172753ff3c95a6660ffa0e2a6b00e734202caa33ccf9e5d00e8","observation_id":"534693d8-74e2-48b1-87d9-c6c9ce775baa","resolution":{"observed_at":"2026-08-11T05:17:55.850860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.855080Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.855080Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:2864df0577e4f5f4436f5aafb5334b2b8cb77f764e07ecc9a775d1baeb0032e7","observation_id":"b8249ded-ee17-4de7-b738-8b9f07ef0f4b","resolution":{"observed_at":"2026-08-11T05:17:55.855080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.859191Z","title":"An integrated data processing framework for pretraining foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.859191Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e18291402d6403222783f1f23f4d2da574850549a72090245cf6d9876a2db736","observation_id":"067a34e9-01f5-4deb-ad99-eaf1f3bd5113","resolution":{"observed_at":"2026-08-11T05:17:55.859191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-08-16T14:31:14.859540Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-11T05:17:55.863452Z","title":"Spike no more: Stabilizing the pre-training of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.863452Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:0b92d2fa25cbe4ec6bc712b9ad5c4cb8a56cee60d5ca305200ab53cc56202354","observation_id":"ebafdae7-2f71-4a6e-8c3a-b718eab9b0c1","resolution":{"observed_at":"2026-08-11T05:17:55.863452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.868198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.868198Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:90c93979423729f5e181911a233ff6c99d7094101477cb4332ae1b4456ab5e11","observation_id":"f6830659-a783-475b-91fb-768d22f64b1c","resolution":{"observed_at":"2026-08-11T05:17:55.868198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.872360Z","title":"LLMBox : A Comprehensive Library for Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.872360Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:8edaf5b1c5d4240793cdc14f8a0afb3c8d3f46ab0ae9279eee1e912c737d626d","observation_id":"f0a4b540-0312-49a1-8aa8-e20ccd484eff","resolution":{"observed_at":"2026-08-11T05:17:55.872360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.877674Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.877674Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:71cf1248a8d2b982f3858565ed99413fcd998bc1b786c73b5b0f5f4f2bf31c6a","observation_id":"b99b19bd-383b-440d-bc06-50cc5082675c","resolution":{"observed_at":"2026-08-11T05:17:55.877674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.881542Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.881542Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:523f32e9617e40212ae22ea891b1914bb7090e7f8e9d836b2b862d5da2060763","observation_id":"2e309652-293c-493e-8eba-e2a1cf5f4941","resolution":{"observed_at":"2026-08-11T05:17:55.881542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:17:55.885313Z","title":"D4: improving LLM pretraining via document de-duplication and diversification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.885313Z"},"links":{"citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:e40b199ace06571c51e48bb29d7d5a37902eeaf68657daf290f2467e6df75fec","observation_id":"d2abf91c-b95f-4497-b093-4e5a31d32053","resolution":{"observed_at":"2026-08-11T05:17:55.885313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11029","last_updated":"2024-10-24T17:56:14Z","snapshot_observed_at":"2026-08-17T03:33:10.772067Z","submitted_at":"2024-08-20T17:30:48Z","title":"Scaling Law with Learning Rate Annealing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11029","snapshot_observed_at":"2026-08-11T05:17:55.889322Z","title":"Scaling law with learning rate annealing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T05:17:55.889322Z"},"links":{"cited_paper":"/paper/2408.11029","citing_paper":"/paper/2412.17743"},"observation_digest":"sha256:7a492b4b9b7d985bc8be556386b68084a8b3eb5bdf2cf99d2e38f67647548cda","observation_id":"743e5dc6-35c4-4390-8c15-ea78498a6d02","resolution":{"observed_at":"2026-08-11T05:17:55.889322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":135},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 135 outbound references and 2 inbound Pith citation observations for arXiv:2412.17743."}