{"as_of":"2026-08-09T14:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ff77252d879f961d94fb47031c1ad668c5421f9a052763045184e8c1655464d","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:26:36.017309Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16097/citation-record","integrity":"/paper/2607.16097/integrity","json":"/paper/2607.16097/citation-record.json","paper":"/paper/2607.16097"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03893","last_updated":"2024-10-04T19:51:03Z","snapshot_observed_at":"2026-08-05T03:45:08.790407Z","submitted_at":"2024-10-04T19:51:03Z","title":"Human-aligned Chess with a Bit of Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03893","snapshot_observed_at":"2026-08-01T21:26:32.196479Z","title":"arXiv preprint arXiv:2410.03893 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.196479Z"},"links":{"cited_paper":"/paper/2410.03893","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:07ed556f924db076b80e0caa20fa852c7ee2f30e2e74574197d301a875bdf10e","observation_id":"78c1ecb4-d656-4c8d-ba3f-de8d4f0e6350","resolution":{"observed_at":"2026-08-01T21:26:32.196479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.245778Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.245778Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:960d59a043e3a9854d1a96d6d600a70bd3f1796b874b3c7dcd2065b4676c2cd0","observation_id":"24b31eb4-1cc8-4f77-b48a-95641d23a195","resolution":{"observed_at":"2026-08-01T21:26:32.245778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T21:26:32.325889Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.325889Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:724fedd38974101f7af180aef77fa863c0971782dd5a47bc41d01dda2a851359","observation_id":"b0bc2b55-2ce2-4f5c-936b-f1642c36a28b","resolution":{"observed_at":"2026-08-01T21:26:32.325889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-01T21:26:32.388270Z","title":"arXiv preprint arXiv:2409.19256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.388270Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:c531d3624952f2accf80c76c04eb4f46f49e20da4cf7d17c85745db6be23ede5","observation_id":"4ca9d9e2-8735-488a-ab05-c3bda2e0d27b","resolution":{"observed_at":"2026-08-01T21:26:32.388270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-01T21:26:32.456353Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.456353Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:a38a3fe47ff61b7bf70479b2bf640922cff21422ab0ff22f9e9bc1970dcbaaa6","observation_id":"cebc0c53-dddb-4c49-8821-ec843289af4d","resolution":{"observed_at":"2026-08-01T21:26:32.456353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-01T21:26:32.517791Z","title":"arXiv preprint arXiv:2203.15556 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.517791Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e46b9dba2939366d27e09240e932c1719f4b8578f1a00ad76e35d59624b3c40d","observation_id":"c354859d-0e8c-448e-8406-5892327cbe32","resolution":{"observed_at":"2026-08-01T21:26:32.517791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.556078Z","title":"arXiv preprint arXiv:2509.21016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.556078Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:871ce1ae0f7a5e66380509a61153e1da451118c34a4a539474c5c66d595aed13","observation_id":"45fc3c09-1649-4265-b169-8500af46fc1a","resolution":{"observed_at":"2026-08-01T21:26:32.556078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20311","last_updated":"2024-07-29T17:52:40Z","snapshot_observed_at":"2026-07-06T18:53:35.627045Z","submitted_at":"2024-07-29T17:52:40Z","title":"Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20311","snapshot_observed_at":"2026-08-01T21:26:32.620292Z","title":"arXiv preprint arXiv:2407.20311 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.620292Z"},"links":{"cited_paper":"/paper/2407.20311","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:49a4d18055e8e9171cab023fe077ceada6782bbd7e85f42420709047056eb3e4","observation_id":"626e3a08-4e60-4c35-907e-4d49baadecca","resolution":{"observed_at":"2026-08-01T21:26:32.620292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.665546Z","title":"arXiv preprint arXiv:2509.25123 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.665546Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:79d2c583f729ff81e0d45ea145bd0a59e3275a5d58b24d34a258497a3f199373","observation_id":"b6ae222a-ec23-46e0-b510-42e7fb47b6a1","resolution":{"observed_at":"2026-08-01T21:26:32.665546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-01T21:26:32.726200Z","title":"arXiv preprint arXiv:2510.13786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.726200Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:cc32310d19966e6f0bba3f43547d50f14812bed9dad72735681431d94bf490af","observation_id":"b84ad023-1d0f-4acb-8a1b-f1c422cb1437","resolution":{"observed_at":"2026-08-01T21:26:32.726200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.746663Z","title":"arXiv preprint arXiv:2512.07783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.746663Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e1b43b261ed08a208168f0df5f7ead2e90b37b7deb9d76719ca05fd4a71ff7a0","observation_id":"c70e37f8-63be-4dba-b5d7-78eeefc9767f","resolution":{"observed_at":"2026-08-01T21:26:32.746663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.826713Z","title":"arXiv preprint arXiv:2506.16029 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.826713Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ced02e6081bd1e9512b72ca28d0253b8b308f9ca99d0b055002f54797376d42e","observation_id":"92239618-bc87-45f7-950c-e08f769ec455","resolution":{"observed_at":"2026-08-01T21:26:32.826713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.962357Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.962357Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:8cf5807a9158428e90b4cb9f47efd761cd28f8b1ad0d72ae33890bd67659b4a6","observation_id":"1a3a5358-4373-4775-9e9e-8879069c263a","resolution":{"observed_at":"2026-08-01T21:26:32.962357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18574","last_updated":"2026-04-20T17:57:49Z","snapshot_observed_at":"2026-08-07T11:14:38.167856Z","submitted_at":"2026-04-20T17:57:49Z","title":"When Can LLMs Learn to Reason with Weak Supervision?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18574","snapshot_observed_at":"2026-08-01T21:26:33.106406Z","title":"arXiv preprint arXiv:2604.18574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.106406Z"},"links":{"cited_paper":"/paper/2604.18574","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ac1b04935d239c35bfd5c6d5f546f199417723694abbed1a05c4fa6ebeb1592e","observation_id":"5b0e64e7-b806-40ff-a5b4-d7e81e974fcf","resolution":{"observed_at":"2026-08-01T21:26:33.106406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.207178Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.207178Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:3c5f8e0162b4495ba96dc2c38efc80e0108e3f4d6ce0cd78e356efe640a7d424","observation_id":"a45fb5e0-7c75-4a33-82a4-4f8f70bba4ed","resolution":{"observed_at":"2026-08-01T21:26:33.207178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08291","last_updated":"2023-05-15T01:18:23Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-15T01:18:23Z","title":"Large Language Model Guided Tree-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08291","snapshot_observed_at":"2026-08-01T21:26:33.265609Z","title":"arXiv preprint arXiv:2305.08291 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.265609Z"},"links":{"cited_paper":"/paper/2305.08291","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:1ca7317b4e959393f50460e9e7f001393448de77d440d5a7a3324c26ae573e99","observation_id":"9b6e379a-522a-4a4b-8ec7-34e3ae3ab709","resolution":{"observed_at":"2026-08-01T21:26:33.265609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-01T21:26:33.359440Z","title":"arXiv preprint arXiv:1712.01815 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.359440Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:3e299c71874358522cea74134f6f9a087088bd52f285b23e9fba1dc96bc8333e","observation_id":"08f6bcbd-825e-4aa6-a44a-bc9b8da73d75","resolution":{"observed_at":"2026-08-01T21:26:33.359440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-01T21:26:33.421318Z","title":"arXiv preprint arXiv:2504.13837 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.421318Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:40930187d8d14f4a4b657b53e826d6e75cccc2da10808d342e1e23be683a583c","observation_id":"4a5557aa-a76f-4593-86ce-5065c85fd2cc","resolution":{"observed_at":"2026-08-01T21:26:33.421318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.498829Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.498829Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:feb07466be67b2ecbf79f639fd49237c110121bcfa8563f24f26015710c6d678","observation_id":"4799bc1c-e8c3-4fe1-95fe-fecb6d52b39d","resolution":{"observed_at":"2026-08-01T21:26:33.498829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.572158Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.572158Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:6516b84f6e2a4b87dc7c32ec188938b608726de74af5ba651e6e3a1e6a4704a3","observation_id":"409cf8b7-2a5f-430f-8756-d6a2e22989b6","resolution":{"observed_at":"2026-08-01T21:26:33.572158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-01T21:26:33.626064Z","title":"arXiv preprint arXiv:2510.14901 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.626064Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:826f2ed838a3e3549941b2a3388c71a9f9a9c4f302d7f2f21b9bcc7ce9225c9f","observation_id":"8806f68c-2a92-4957-9c86-840f6788134a","resolution":{"observed_at":"2026-08-01T21:26:33.626064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.688075Z","title":"arXiv preprint arXiv:2603.24844 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.688075Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:3be6b18f58f216b5282d54d94e9d1e967889d70889bcf84f188eb99cdb785c2b","observation_id":"8a1576f0-0758-4d8b-93da-12f169afbe46","resolution":{"observed_at":"2026-08-01T21:26:33.688075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.743899Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.743899Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:2208a57b00cd039fe8ca6251e43e732c23bbfc5983503baab8db1d1ca2a8d665","observation_id":"3108f45c-5ee9-4bf9-99c1-a35a01ca66e3","resolution":{"observed_at":"2026-08-01T21:26:33.743899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.794436Z","title":"arXiv preprint arXiv:2510.03264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.794436Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:d2c2a8fdb3f9ff4e60a6f7c4cb76c20bdd029b96eb62651847d7e384789b77ea","observation_id":"b0ff0808-fe3f-49b6-8fff-7ecd19d83944","resolution":{"observed_at":"2026-08-01T21:26:33.794436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-07T20:44:00.088711Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04272","snapshot_observed_at":"2026-08-01T21:26:33.858637Z","title":"arXiv preprint arXiv:2606.04272 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.858637Z"},"links":{"cited_paper":"/paper/2606.04272","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:53ac39dfa26057780682ee1db0513bd3630e93e5f7b67bc14b8bceb893765f99","observation_id":"9a5d67da-066c-4e9a-9def-35c2a8f57ba4","resolution":{"observed_at":"2026-08-01T21:26:33.858637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19206","last_updated":"2025-03-28T02:10:05Z","snapshot_observed_at":"2026-08-07T16:39:47.680195Z","submitted_at":"2025-03-24T23:11:56Z","title":"Overtrained Language Models Are Harder to Fine-Tune","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19206","snapshot_observed_at":"2026-08-01T21:26:33.911069Z","title":"arXiv preprint arXiv:2503.19206 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.911069Z"},"links":{"cited_paper":"/paper/2503.19206","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:cc3d7df364fb5620aae6ebc364a8cfd274a77a935755037e19d00ab78bccd109","observation_id":"ea635115-ac45-4d79-8c01-04e2eec82f04","resolution":{"observed_at":"2026-08-01T21:26:33.911069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T21:26:33.973602Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.973602Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:da6789b42bf989314c82e1ed1d7b53d07c697fbd0135d8716b58169a0bfbaed0","observation_id":"23efc518-9d68-4987-9e7c-d30238763bf6","resolution":{"observed_at":"2026-08-01T21:26:33.973602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.025800Z","title":"2003 , publisher=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.025800Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:3828291b8eef2dbaeb4489e64d9dd74c04f5d511145da0b2b241049fdc64cdb3","observation_id":"784ade2e-5bac-4cbe-abaf-ac0d8f2f6811","resolution":{"observed_at":"2026-08-01T21:26:34.025800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.113763Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.113763Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:d449dcd9b56fb63706580d3b5d329276269c9321d8ee621b83347acca83bbbf7","observation_id":"fdab7b28-675e-48c1-853b-0c0ea6516391","resolution":{"observed_at":"2026-08-01T21:26:34.113763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T21:26:34.227557Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.227557Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:88b3d060770fb77cd4e3e368b22f5c2a821eb134048de9267f0bd9e63afd5358","observation_id":"6d29db7a-b219-4134-ae32-310a7918d01d","resolution":{"observed_at":"2026-08-01T21:26:34.227557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21878","last_updated":"2025-04-07T17:44:38Z","snapshot_observed_at":"2026-08-07T16:31:54.737337Z","submitted_at":"2025-03-27T18:00:08Z","title":"Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21878","snapshot_observed_at":"2026-08-01T21:26:34.271964Z","title":"arXiv preprint arXiv:2503.21878 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.271964Z"},"links":{"cited_paper":"/paper/2503.21878","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:d2f92c4aabdcc1a2018fc0f4d9280effcd85be1714cf427fc11828eb9c42ba3b","observation_id":"77660dd6-614d-41b8-b6d4-c78b36dbc429","resolution":{"observed_at":"2026-08-01T21:26:34.271964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-01T21:26:34.361691Z","title":"arXiv preprint arXiv:2512.13961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.361691Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:991b78195932b7801d85a52f24a3a2ca6f8513a5b943f154db8013840f13375f","observation_id":"8bd31739-576a-4b1c-85d7-c12eb9916ab5","resolution":{"observed_at":"2026-08-01T21:26:34.361691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.431145Z","title":"Notion Blog , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.431145Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ba68417345950a3f488cc7b2293e5519edace50f2ef465f2d4ee650f162f9de2","observation_id":"e725fcb1-eca8-4e91-8e3f-0c858c3bdd0b","resolution":{"observed_at":"2026-08-01T21:26:34.431145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-01T21:26:34.509727Z","title":"arXiv preprint arXiv:2501.00656 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.509727Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:70098b2149e49c5813f697595bbc27608a8aa4d0ff28a5dd725ee1bb686b237e","observation_id":"cd460ae0-bd66-41f7-a510-52a33a7802e0","resolution":{"observed_at":"2026-08-01T21:26:34.509727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.573030Z","title":"Hugging Face repository , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.573030Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:feb19b8b1e05b5d6bf90914893ba46d39ec2e2965d922cc64738a109c4116b4a","observation_id":"937a5172-5451-4180-b85c-fd5f55e941b1","resolution":{"observed_at":"2026-08-01T21:26:34.573030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.633423Z","title":"arXiv preprint arXiv:2512.15489 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.633423Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:84483900d4de7fd10843a06ca92de974bdeffe1bbbfefe51915913c7b5a1044a","observation_id":"b6844668-ff3a-4f18-bbd6-daf0aabebbad","resolution":{"observed_at":"2026-08-01T21:26:34.633423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.713790Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.713790Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:8d39c92c4054e669f009f8bae1e2795353b6baf74a509f1972e935225a9d2c90","observation_id":"28e949f9-a828-4357-bdb5-b64bf1caffa6","resolution":{"observed_at":"2026-08-01T21:26:34.713790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.786841Z","title":"Proceedings of the 41st International Conference on Machine Learning , articleno =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.786841Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:68699c6d47c49ff500ea09a0ef3439c9d4c4cbdb21afdd70af0f0e3cf5505c30","observation_id":"53615201-a48e-4812-9c48-2a8b6d14d0b2","resolution":{"observed_at":"2026-08-01T21:26:34.786841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.855268Z","title":"arXiv preprint arXiv:2604.01411 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.855268Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:0a04b5e5e1e4b36d545afa0c280ea389f97e336235c10b00bc25f340a0a77c6b","observation_id":"709bf90f-e0d2-48f8-b25b-5349a2feb3bb","resolution":{"observed_at":"2026-08-01T21:26:34.855268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.944396Z","title":"arXiv preprint arXiv:2503.19551 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.944396Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:86b67c7c3abd6095abfcda594aef6f06df7bfbb60d75816b706679b59d031ba1","observation_id":"9ab0fc64-d5c4-4525-b062-90ff395db5a3","resolution":{"observed_at":"2026-08-01T21:26:34.944396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.036633Z","title":"arXiv preprint arXiv:2603.12151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.036633Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e2191b637009df1c0791ae5a09b59822e175dd63d3252f5982215ad3bc289509","observation_id":"e1aa124e-f5a7-40f8-8bbb-47722f4c3f60","resolution":{"observed_at":"2026-08-01T21:26:35.036633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.100440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.100440Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:7fa3ed06346c0b779caf56766eb74f1e9cdc6cd4cdbf55ffda20df73d5841164","observation_id":"4785bc8e-996f-4b65-a777-71c970f5b7cc","resolution":{"observed_at":"2026-08-01T21:26:35.100440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-01T21:26:35.191672Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.191672Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:0844defaed0d27c7ccbc8617d694f9cc1127b78413e6afd934944f7552d11a58","observation_id":"5b9ac02a-dbd0-464c-a7fa-f04b92ac1b3f","resolution":{"observed_at":"2026-08-01T21:26:35.191672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T21:26:35.256751Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.256751Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e51b69676a07a86ab3630c53c5641618a320296fd95898a2618718a9ed2e57b8","observation_id":"9d0ee7bb-462d-4f8d-b77c-7d7be8780496","resolution":{"observed_at":"2026-08-01T21:26:35.256751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-01T21:26:35.371952Z","title":"arXiv preprint arXiv:2503.18892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.371952Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:0f4791833075a6c29e2e2eda42e36de8c9ffae7dfb9a763c30fdd864a5b4c52a","observation_id":"3e830194-4084-4a75-8762-4b6451a1e9db","resolution":{"observed_at":"2026-08-01T21:26:35.371952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T21:26:35.468782Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.468782Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:9e3286f5f9aed268a69d0a3b95e2bbdfb10f31d58b8c28c92e8c83269a8e16e9","observation_id":"0efc0bd5-37b3-490e-86aa-af80a7317620","resolution":{"observed_at":"2026-08-01T21:26:35.468782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.533985Z","title":"Google AI , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.533985Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ad24c8fd71ce4777210e0e4cb7bdf0aadc3d534dcb5d80f91165d5338cc340a3","observation_id":"473d8c2d-476f-4065-836f-32d1657426be","resolution":{"observed_at":"2026-08-01T21:26:35.533985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.635555Z","title":"nature , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.635555Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:12530b7445bd638ae6b0ea087bfa05ff21ebfe1083768adf5bcd0104d0bac97c","observation_id":"84f78f46-bfb5-49b4-852a-90d2f2a76c47","resolution":{"observed_at":"2026-08-01T21:26:35.635555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.793794Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.793794Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:06cc8c1684181bce007166ff7dbe65a5162a905e6953567c4fb4b75fad63f826","observation_id":"6e532969-9a8e-4aa0-953d-7b2c4afde200","resolution":{"observed_at":"2026-08-01T21:26:35.793794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-01T21:26:35.909813Z","title":"arXiv preprint arXiv:2312.09390 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.909813Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:b531964b6c20050f00484c2eec33154db435328eee4cb70126bd90fe6b1e2655","observation_id":"27fc059a-610b-4a7b-897f-6a6bfd8f15ce","resolution":{"observed_at":"2026-08-01T21:26:35.909813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15096","last_updated":"2025-08-20T22:16:57Z","snapshot_observed_at":"2026-08-05T18:08:02.752427Z","submitted_at":"2025-08-20T22:16:57Z","title":"Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15096","snapshot_observed_at":"2026-08-01T21:26:36.017309Z","title":"arXiv preprint arXiv:2508.15096 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:36.017309Z"},"links":{"cited_paper":"/paper/2508.15096","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:6a55c29e79f96c1d160b078558d4f9eaf80fd061e477a90e174e8fbbd2de756f","observation_id":"7fa24bc0-fc18-4e03-b808-19433a53a2e6","resolution":{"observed_at":"2026-08-01T21:26:36.017309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T17:15:55.816920Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.16097."}