{"as_of":"2026-08-18T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54ca2c2ca6e4e8834f9c9e89d56a4f70220571aac8897d1349aec4768a1d3cc6","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:30:40.435211Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02338/citation-record","integrity":"/paper/2506.02338/integrity","json":"/paper/2506.02338/citation-record.json","paper":"/paper/2506.02338"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:30:40.095403Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.095403Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:e53022b0a2e2df22443c48972648227c4b1c82ea706958df2a946d6b6557608b","observation_id":"3a620c53-2971-4c03-be1c-26aed213bb56","resolution":{"observed_at":"2026-08-07T11:30:40.095403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T11:30:40.109082Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.109082Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:bbe9868116c6ce157bddd730b313a6f91ed5ee1b9a779b7fe026f38434cb75d8","observation_id":"fafcd2b1-2580-4a82-a3e3-1cafd5624b9c","resolution":{"observed_at":"2026-08-07T11:30:40.109082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:30:40.120327Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.120327Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:15eabf6ca9cdfe3148b59722113e4d5dc9398a305e937187d7220174ff434de3","observation_id":"470914d3-e96b-4022-8e51-24794ef3b387","resolution":{"observed_at":"2026-08-07T11:30:40.120327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:30:40.129217Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.129217Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:9630b25cfb067fa0cc8fa5cad5232aa48920f8b9f042dcd0da210ac2b3bfc068","observation_id":"8336a38d-68dd-4876-8394-68288d115880","resolution":{"observed_at":"2026-08-07T11:30:40.129217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-07T11:30:40.139932Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.139932Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:ae8564faf0d6815a3146ff3f22e75f5088e7ec29def409fdc713b228b6f372cd","observation_id":"abc0b61a-31c9-4586-8bf7-70f503b7e8fe","resolution":{"observed_at":"2026-08-07T11:30:40.139932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:30:40.149670Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.149670Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:f5e857b32de2bf6393442101fb094345fddf4fd22094f991a60c737d1c678f18","observation_id":"8144c61d-b6dc-4247-8e83-bd410c59b013","resolution":{"observed_at":"2026-08-07T11:30:40.149670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T11:30:40.159435Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.159435Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5dee8277b454c2639698c83a2246df0e96c4f63d445711607f11b040e2c601d0","observation_id":"a407ff1e-8f7f-4c45-9e09-ba3f39fc24a4","resolution":{"observed_at":"2026-08-07T11:30:40.159435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-07T11:30:40.166528Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.166528Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:35e3e999da05fc53fcdbf1298b16e9cd6e76f8d59a67fc0e1b0010f4a7e52ea4","observation_id":"0d5b3497-a783-48d8-bd38-4be515430b98","resolution":{"observed_at":"2026-08-07T11:30:40.166528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-18T04:26:49.778619Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T11:30:40.175491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.175491Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:9588a5d6ab2828e6bf48a89548b307673acc82a0e2e58a267aa5ecb03a0663b4","observation_id":"c36feee3-b382-499b-9777-4e8baec108c3","resolution":{"observed_at":"2026-08-07T11:30:40.175491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-13T15:08:13.316080Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-07T11:30:40.181809Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.181809Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:f9898a87617223b1550cb327031a38c30f404583208ccf9f4d8a2a7c3eda498f","observation_id":"138d07e0-6681-424c-993c-7834b5af1842","resolution":{"observed_at":"2026-08-07T11:30:40.181809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.156676Z","title":null,"venue":null,"work_id":"5daf54d7-48db-4b33-9ca8-785e1866640c","year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.190888Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:36901cf6af60720d6e60843e28081252649c8dea264503ac34582dbb27c7bd0d","observation_id":"6a63a3a0-0fdf-47cb-a435-65664274dc02","resolution":{"observed_at":"2026-08-07T11:30:42.170900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T11:30:40.198182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.198182Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:b392a4f2f1b3406b6b3b81436cffd03cd92ae32e9ccd0c37a6d8ed908d9c983f","observation_id":"75a3efd2-fc16-4e71-93ea-e76bcfddf22d","resolution":{"observed_at":"2026-08-07T11:30:40.198182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.129410Z","title":null,"venue":null,"work_id":"8946dd50-0d06-4413-a094-c482adcf16fc","year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.207318Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:e42012ea27f5b64bee247c4506ad77a54d3aac3aaedada4219267ca3579f5c8c","observation_id":"af14dcbf-dada-4fe0-a10c-0f134e11cae6","resolution":{"observed_at":"2026-08-07T11:30:42.137299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05318","last_updated":"2024-10-05T05:21:48Z","snapshot_observed_at":"2026-08-16T13:12:22.849830Z","submitted_at":"2024-10-05T05:21:48Z","title":"Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05318","snapshot_observed_at":"2026-08-07T11:30:40.214833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.214833Z"},"links":{"cited_paper":"/paper/2410.05318","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:72564c7b9cd4ab3f30f5960ccbb74b7992d0eecde0aa6d293ae0625d5a7fcfda","observation_id":"59e8e1e9-4b76-4c12-8e4d-39a0f264ed32","resolution":{"observed_at":"2026-08-07T11:30:40.214833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T11:30:40.222867Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.222867Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:9330a3d97eeba6e4f0fff4a8fba19acf6bfd7d53a12f6c16a779e1ee6be33e45","observation_id":"fbd92be8-c84b-4151-9a72-4c0cbb2b1a24","resolution":{"observed_at":"2026-08-07T11:30:40.222867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T11:30:40.232268Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.232268Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:30bb6a67d0cbca606a4c0109a2c3a4dc7a3de718694c0ba3146e667bb419eb10","observation_id":"196780c7-d2c6-4134-9ae4-6c4362406864","resolution":{"observed_at":"2026-08-07T11:30:40.232268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T11:30:40.243867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.243867Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:899c1d438f41d9d0a146237f4bb7b391b747ebf72627cecabe7b888c199cf50f","observation_id":"38c2129e-14fb-4c30-b090-1a8270f5421c","resolution":{"observed_at":"2026-08-07T11:30:40.243867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.086077Z","title":null,"venue":null,"work_id":"9440a3f3-9ee9-4aba-ab6b-0340d2b9ad74","year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.249490Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:2ffecdf691a40213302dc2b4b550e5c513ee383bd2e19d6c240c1d1b589778eb","observation_id":"5791fb73-f390-4b0c-a883-11e76bfef89e","resolution":{"observed_at":"2026-08-07T11:30:42.101056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.054242Z","title":null,"venue":null,"work_id":"349e3caf-da5e-45dd-b747-d1c557dde910","year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.256938Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:6b584accb4f862acac3b0c70f4bac44aa977c636956c5d361be742d1694494df","observation_id":"133c582f-5501-454a-ae21-ee900206634e","resolution":{"observed_at":"2026-08-07T11:30:42.061042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T11:30:40.263653Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.263653Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:cebcd57b9ee3f8900f7c9d72ef86980adeb7b672c575af2c15b7825c9bf99397","observation_id":"0bfe602b-2997-480c-bc68-fc6e76f3d866","resolution":{"observed_at":"2026-08-07T11:30:40.263653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03860","last_updated":"2025-02-06T08:19:59Z","snapshot_observed_at":"2026-08-16T00:10:00.927456Z","submitted_at":"2025-02-06T08:19:59Z","title":"BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03860","snapshot_observed_at":"2026-08-07T11:30:40.270967Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.270967Z"},"links":{"cited_paper":"/paper/2502.03860","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:37d023877c2d223c171719d438ec25005723f325575c88b51bcba633392412a4","observation_id":"7386175c-0d20-478c-8879-b89f2fd30cf5","resolution":{"observed_at":"2026-08-07T11:30:40.270967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:30:40.279569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.279569Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:2c7c4dd594ff3b5cfdb3eb6a38ce3c299a7e8fcfc4d4a496da16acbefcd61676","observation_id":"51ad3838-3c8f-4fc4-8ea4-36de2e5e33f6","resolution":{"observed_at":"2026-08-07T11:30:40.279569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T11:30:40.292039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.292039Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:0f0300374e275079b7c2c6ea4530decbe9589c471c6a7ade97b7afc97d2aea81","observation_id":"fd945479-6501-437d-ac78-15869f69d8b4","resolution":{"observed_at":"2026-08-07T11:30:40.292039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:30:40.299149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.299149Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:4a01a8eaaf23bb12aad2ea2aeeecfa8093f66c0d6c6cee8bbc41d82d21a63c19","observation_id":"9c46240b-2e4d-4188-8cd7-ad583572395d","resolution":{"observed_at":"2026-08-07T11:30:40.299149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T11:30:40.304456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.304456Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:aa4c708f6308c26924a6affaa8d42ae2d5a3e2d5381e41f092c39a8a2b85c37a","observation_id":"505fc5cd-2c32-4803-932d-35a185277239","resolution":{"observed_at":"2026-08-07T11:30:40.304456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:42.011110Z","title":null,"venue":null,"work_id":"81bb1bef-baa0-48c3-a45e-5d38dd958a5e","year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.310291Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:bc2c94c9009aa7563416b620d76495892df6a8ff5769addb6a3bac6ec43b74a2","observation_id":"c45ae7de-2d83-443e-908b-eef6cfad4427","resolution":{"observed_at":"2026-08-07T11:30:42.020936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:41.966881Z","title":null,"venue":null,"work_id":"65d680f0-59c8-4512-a597-13f505a7e580","year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.319370Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:988aced43ada855d584bc8912db6689f96787130f02fe1f49c16edb69f020c60","observation_id":"0981fa35-cb9a-4e76-baab-9ea9177ab3f3","resolution":{"observed_at":"2026-08-07T11:30:41.977143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.327281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.327281Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:c687dd237c753504e119ca23892764f9a6c8cdfe74b75f4d9c68b6babf9fc760","observation_id":"70e64e28-d9e0-4cd0-89fb-8b2cf5bcde62","resolution":{"observed_at":"2026-08-07T11:30:40.327281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:30:40.332643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.332643Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:aefe152032e79adb7f20e333c1b1c658295074bf0adfdc2d351dcc043d99ace3","observation_id":"c47bf320-e49c-45d4-a33f-144415becc0a","resolution":{"observed_at":"2026-08-07T11:30:40.332643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14283","last_updated":"2024-07-22T10:01:49Z","snapshot_observed_at":"2026-08-16T13:41:07.256700Z","submitted_at":"2024-06-20T13:08:09Z","title":"Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14283","snapshot_observed_at":"2026-08-07T11:30:40.339030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.339030Z"},"links":{"cited_paper":"/paper/2406.14283","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:2d59d0bd58a6672e67654541977ae79fbd9c5cb73f62f60fe6e7021738061866","observation_id":"37be43d1-c47d-4fa3-bea9-6bf92ae3e265","resolution":{"observed_at":"2026-08-07T11:30:40.339030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-07T11:30:40.351279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.351279Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:38cc806424106e47338fc7241e5958ea91b5b61c9479ef3e7998defb33e1e6ac","observation_id":"53536604-b829-430a-a54e-2a8efd3ec156","resolution":{"observed_at":"2026-08-07T11:30:40.351279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-08-15T06:19:06.009960Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-07T11:30:40.358899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.358899Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:8bbd474bf44eeccb7ef21dc39e7da98e077dec32e4f40800833a56b937fc78b2","observation_id":"4f37b2ca-202f-4c65-a786-0e39b2586b8f","resolution":{"observed_at":"2026-08-07T11:30:40.358899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-15T17:15:16.352032Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-07T11:30:40.365512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.365512Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:884f80fe30e4e613335e53deefc6b7f7de47953eb33aa39339b57de5918feed5","observation_id":"db56cecf-9f5a-4d29-9bcf-863d9e379bfa","resolution":{"observed_at":"2026-08-07T11:30:40.365512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-12T12:16:58.791696Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-07T11:30:40.373089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.373089Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:523222c7e14d0c08cb1a40f694c3318bace5be828934b03ec2a664962307e063","observation_id":"a35a4bf7-4597-45b2-9057-8ef4b19a54bf","resolution":{"observed_at":"2026-08-07T11:30:40.373089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T11:30:40.380185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.380185Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:5726dcfce9f2bcebeca8c0a24be54e52e8e772fcaba818557b4d11e1f4e40b9c","observation_id":"0bb73033-dc53-47b9-83ae-7fc1a637e5ab","resolution":{"observed_at":"2026-08-07T11:30:40.380185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-08-17T16:40:23.847561Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T11:30:40.388167Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.388167Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:32add457da69f3823334018483aba9cf611e70f97678b4d849aec8daed8ab7f9","observation_id":"c969852d-8e08-4927-be52-38b9736a4cd4","resolution":{"observed_at":"2026-08-07T11:30:40.388167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-08-10T20:07:53.240207Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-07T11:30:40.394611Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.394611Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:d4aae2884e15824e0c67cac35fb4a46a3be5066dab5977ccc2e4f006da8c3d01","observation_id":"0fa1eb0f-0c63-4a2e-97db-e2b700904a24","resolution":{"observed_at":"2026-08-07T11:30:40.394611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-16T13:12:50.131108Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-07T11:30:40.401314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.401314Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:508c24162deb969bde0d37b34fce480cee6b9ab0a6da84ef1ed772aaac41504e","observation_id":"ab44c3fb-adf0-49fd-91b6-4a4f2c95a478","resolution":{"observed_at":"2026-08-07T11:30:40.401314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00154","last_updated":"2024-12-10T04:39:25Z","snapshot_observed_at":"2026-08-18T08:13:47.309247Z","submitted_at":"2024-11-29T07:19:56Z","title":"o1-Coder: an o1 Replication for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00154","snapshot_observed_at":"2026-08-07T11:30:40.410198Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.410198Z"},"links":{"cited_paper":"/paper/2412.00154","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:fb955eea0c121fa46c97aeca72844353acd525ac2890823f2282d61d468346e0","observation_id":"e5ff97dd-070b-4d5c-be49-0b54664f2870","resolution":{"observed_at":"2026-08-07T11:30:40.410198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T11:30:40.416440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.416440Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:1e6ca11b65b51658ea6646d10daef9c8c834d3cab52bc0bdf116c055f2d6eeae","observation_id":"a2a8c277-e738-4e85-b9bd-732e42193099","resolution":{"observed_at":"2026-08-07T11:30:40.416440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.422849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.422849Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:4447288a0957616267f3c6e5c62ff6ba886cbc76c32e1f1f30cc0baf17407349","observation_id":"bd8639f7-bc2e-41b5-8c96-f5c1e861a5b0","resolution":{"observed_at":"2026-08-07T11:30:40.422849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.428196Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.428196Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:9e2ab33676752401bcd343d6c6d7cac7bf5704e63ade6ee25d49c4d0e2ac2938","observation_id":"43c14ce9-5f8a-4e73-bf90-58096c7406c1","resolution":{"observed_at":"2026-08-07T11:30:40.428196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:30:40.435211Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:30:40.435211Z"},"links":{"citing_paper":"/paper/2506.02338"},"observation_digest":"sha256:c3fb3587c2ba7c879541bab76c0088f5f80c584a0ea373a13ad25eaad5dcc913","observation_id":"5f10d5a3-57b7-431d-ba84-a96b80a47512","resolution":{"observed_at":"2026-08-07T11:30:40.435211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02338","last_updated":"2025-06-03T00:29:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T15:09:47.963101Z","submitted_at":"2025-06-03T00:29:15Z","title":"One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.02338."}