{"as_of":"2026-08-13T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3804195c2692413d8e545c3d8a2086e92b1430e25ede2f79db3e2812beb74ed6","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:03:33.393958Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:32:13.013301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-06T21:21:41.937333Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-07T07:50:07.171627Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:21:41.937333Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2507.00417"},"observation_digest":"sha256:0094c841ca324c25667f93fd91eaba904a4e9264df188d0a7cf75930efeff127","observation_id":"9749439b-2f45-4577-a302-9162374af12e","resolution":{"observed_at":"2026-08-06T21:21:41.937333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T20:21:08.163389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.163389Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d575e3c3793e60fa8a8072b0515f7de27dd7fec974f37150f706c75de46ff487","observation_id":"2dc96f34-873c-4b75-ae35-482082edbde9","resolution":{"observed_at":"2026-08-05T20:21:08.163389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-04T22:59:14.534182Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms.arXiv preprint arXiv:2506.09026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.534182Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:d8e6c9d9ce014d1b73e741a3e5da461016ebdd58f70f047545a85d6238b2a9fb","observation_id":"62e79bd9-5de4-4b91-b579-44a002b56daf","resolution":{"observed_at":"2026-08-04T22:59:14.534182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-04T10:09:03.509893Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms.arXiv preprint arXiv:2506.09026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.509893Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:089ae512556a3baf213d5fac53c14d05c3971dbb15b071d327972663c7a75981","observation_id":"6a1e0385-5950-46db-a390-5826abdc1213","resolution":{"observed_at":"2026-08-04T10:09:03.509893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2601.20829","last_updated":"2026-05-09T10:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T18:29:21Z","title":"Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T10:26:45.961575Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2601.20829"},"observation_digest":"sha256:0f51a61366d637bd0d4fb7ffd6b801e43015d1184f3b3933778a02882ea40588","observation_id":"ac25798b-d911-4be4-9de9-432a70e14263","resolution":{"observed_at":"2026-05-16T10:27:44.448791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:5f2113fbbf52147ab933cccf2efb4b566397a4e9204a33f1154418897bbe3f1d","observation_id":"96a65a17-114f-4a3b-9585-6ae340cd7f01","resolution":{"observed_at":"2026-05-15T16:36:17.923996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-07T12:08:03.856446Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:8ff63e53f2246e0bbe5889a32acd281183ab47442a5bf8d4cc72bcff086ca0f4","observation_id":"97b7fe68-7dfb-4165-bc4e-0cade0795304","resolution":{"observed_at":"2026-05-10T05:36:01.402466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-08-12T15:38:43.672554Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:a34b8617843afcb7cad17db5e0eafdd99739f543f5d8c2c178515acdfea76641","observation_id":"11b5d117-b3eb-4c77-8be0-13e8c12225c7","resolution":{"observed_at":"2026-05-09T06:10:42.517079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-08-12T15:38:43.672554Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:c27670b54405a74aecb72e58cd3c862aa9fe7ee862f91707415a8bcd588b2a04","observation_id":"9de63b67-d0db-426d-ae15-87987fce5a98","resolution":{"observed_at":"2026-07-01T00:05:09.652333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:a13647dabe9a777c0c82bff43100ba1d4cfb0bcc7d4f4545d6a21a6ce8dec4b4","observation_id":"978bf51c-3054-476a-bfff-6e3746dd43dd","resolution":{"observed_at":"2026-07-02T12:06:56.433620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-13T00:39:41.357427Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:22776b5de75ad75fd4a23f41f443c37643dd9bd1f0a0b64559a05104a92598a1","observation_id":"18fc5695-e22c-4d53-9796-fff3c94285ae","resolution":{"observed_at":"2026-07-02T12:16:56.964580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-11T10:32:13.013301Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-13T13:20:55.578794Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.013301Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:fd2747edaede124d78084b5db99136cb4988ae3e33daa918ea0ec1d3a971dcbc","observation_id":"a38eab6a-6954-4594-88ba-7018c0acc17e","resolution":{"observed_at":"2026-08-11T10:32:13.013301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09026/citation-record","integrity":"/paper/2506.09026/integrity","json":"/paper/2506.09026/citation-record.json","paper":"/paper/2506.09026"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:25.231877Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift.Journal of Machine Learning Research, 22(98):1–76, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.231877Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:e5eebaa5419bd5c943266aa10f726b5d779f90ae963b71169f447a581a106af0","observation_id":"563ffcf9-a85f-4873-935f-8451d9f9cbf1","resolution":{"observed_at":"2026-08-07T05:03:25.231877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T05:03:25.293292Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.293292Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:620c29e81606e4af547ffa73cd2283cbdce0cdc1bcc611c22cf03f837d277a0d","observation_id":"bef38348-1375-4b6c-84e8-f52d09fd0b6d","resolution":{"observed_at":"2026-08-07T05:03:25.293292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:03:25.334902Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.334902Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:5d5dd5371e6bfe051cf50b8e6069b53c95f6c9ebba9b38e7832e2cd7d7417a43","observation_id":"dadfa8ab-d078-4d79-bdbd-7b99b5afe111","resolution":{"observed_at":"2026-08-07T05:03:25.334902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T05:03:25.373350Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.373350Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d2cf299de5c3aeb3cfd6b33d0bf2e37ee125d320259dad813ba6c69bb94653b6","observation_id":"75d7da3b-4d43-4d9b-8a91-a506884db8d7","resolution":{"observed_at":"2026-08-07T05:03:25.373350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:25.417829Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.417829Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b08f322c2d8b08f3908415186b91f44208824836fc0844da71a89f4bef9fdd0c","observation_id":"d8abdacc-97b9-40be-8a4e-b4f4c1bcec04","resolution":{"observed_at":"2026-08-07T05:03:25.417829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-12T20:26:28.956960Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-07T05:03:25.549636Z","title":"Rl2: Fast reinforcement learning via slow reinforcement learning.arXiv preprint arXiv:1611.02779, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.549636Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:5350455793c8550366f75df94c4375618c5141a667977a6434a646be686f5a68","observation_id":"34bfbdea-a97e-407a-aa9e-0084dca6ec06","resolution":{"observed_at":"2026-08-07T05:03:25.549636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:25.613833Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.613833Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:915473cf53409b1d582046674e0a53dc9e731c501c0ef73748508729a79afb72","observation_id":"50086ad2-4bd5-4074-a2df-9092189d01b8","resolution":{"observed_at":"2026-08-07T05:03:25.613833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-13T00:40:17.879636Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-07T05:03:25.660715Z","title":"Stream of search (sos): Learning to search in language.arXiv preprint arXiv:2404.03683, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.660715Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:acf4281b24497c133f7fbf8749dba3673fcecc5ce7c6893df7ea2e1322f6d2e1","observation_id":"3dbd99e9-5309-4290-99df-a3a249b670c8","resolution":{"observed_at":"2026-08-07T05:03:25.660715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T05:03:25.755143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.755143Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:71a637c44f59fdd23557b9ff05e7a2a3a271914293fd71fac56a2f4879321ae5","observation_id":"b874ac4e-68f7-4292-9003-d210c3136e34","resolution":{"observed_at":"2026-08-07T05:03:25.755143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12894","last_updated":"2019-07-30T13:31:07Z","snapshot_observed_at":"2026-08-10T18:28:05.401026Z","submitted_at":"2019-07-30T13:31:07Z","title":"Reward Learning for Efficient Reinforcement Learning in Extractive Document Summarisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12894","snapshot_observed_at":"2026-08-07T05:03:25.809592Z","title":"Reward learning for efficient reinforcement learning in extractive document summarisation.arXiv preprint arXiv:1907.12894, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.809592Z"},"links":{"cited_paper":"/paper/1907.12894","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0d62b651f68f8e2cf5460ce67c5f6df7549a3aa2ee92e5f9b8b7c4a22f1889bb","observation_id":"dc605c3a-310f-4ff3-9b8f-329b499d21c4","resolution":{"observed_at":"2026-08-07T05:03:25.809592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06277","last_updated":"2021-07-13T17:59:25Z","snapshot_observed_at":"2026-08-11T11:39:02.534310Z","submitted_at":"2021-07-13T17:59:25Z","title":"Why Generalization in RL is Difficult: Epistemic POMDPs and Implicit Partial Observability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06277","snapshot_observed_at":"2026-08-07T05:03:25.861972Z","title":"Adams, and Sergey Levine","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.861972Z"},"links":{"cited_paper":"/paper/2107.06277","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0ca0ea9d7cf941cc45603a26e505eafb7d4563ff72dc0a494a7ba1e2bbc117df","observation_id":"5601a49a-b4a1-448d-b99c-c8f541ae153c","resolution":{"observed_at":"2026-08-07T05:03:25.861972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.04640","last_updated":"2020-04-30T16:55:56Z","snapshot_observed_at":"2026-08-09T23:01:12.439050Z","submitted_at":"2018-06-12T16:48:52Z","title":"Unsupervised Meta-Learning for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.04640","snapshot_observed_at":"2026-08-07T05:03:25.925948Z","title":"Unsupervised meta- learning for reinforcement learning.CoRR, abs/1806.04640, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.925948Z"},"links":{"cited_paper":"/paper/1806.04640","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:822c25f024aa481f020797ee95f6b6f8a968624873cf38df8b76c9381ea9b1d9","observation_id":"5ee39a6f-de9c-45e7-b557-533f155b25a5","resolution":{"observed_at":"2026-08-07T05:03:25.925948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02690","last_updated":"2019-01-26T01:54:32Z","snapshot_observed_at":"2026-08-05T14:48:12.142477Z","submitted_at":"2018-12-06T18:15:44Z","title":"Provably Efficient Maximum Entropy Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02690","snapshot_observed_at":"2026-08-07T05:03:25.984106Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.984106Z"},"links":{"cited_paper":"/paper/1812.02690","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:18a21aae0a0bb5253e40a4a250cdec86d76d0a8d6e8393426b5e369c8ae9c2e2","observation_id":"be508c46-43de-44ef-ad57-19332c637362","resolution":{"observed_at":"2026-08-07T05:03:25.984106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.061189Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.061189Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:eaa8f11b22bf06832c2904ba37e5ab89bfd6b9eb7e6c6d54b31feb7dff74716f","observation_id":"fa5bae73-d49d-4d36-a620-4458f701bdf4","resolution":{"observed_at":"2026-08-07T05:03:26.061189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-11T23:57:27.579600Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T05:03:26.163556Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.163556Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:cea666007e4d31fece07c7174bcee4e9f5c8642dc2f686af61d651b1340956fb","observation_id":"2244849d-c21a-4ff2-82fb-0ec8ec7e670a","resolution":{"observed_at":"2026-08-07T05:03:26.163556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19877","last_updated":"2026-07-16T03:37:34Z","snapshot_observed_at":"2026-08-08T12:26:31.053048Z","submitted_at":"2025-03-25T17:41:18Z","title":"Scaling Evaluation-time Compute with Reasoning Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19877","snapshot_observed_at":"2026-08-07T05:03:26.243355Z","title":"Scaling evaluation-time compute with reasoning models as process evaluators.arXiv preprint arXiv:2503.19877, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.243355Z"},"links":{"cited_paper":"/paper/2503.19877","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d71b84fbc9e5b59a76194a9b7e2633298e4304a9f5f050023c7418a02a57f7c2","observation_id":"55ff2b50-c5fd-4950-a02b-65d83d0fd24a","resolution":{"observed_at":"2026-08-07T05:03:26.243355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-08-13T08:34:54.250401Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-07T05:03:26.307343Z","title":"Can large language models explore in-context?arXiv preprint arXiv:2403.15371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.307343Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b2100fd0a57f2089bfbcbd9fd49a98291d2d7b5601ff62fdafcce0c46492bd6a","observation_id":"c14075a3-af6b-4cea-a2df-df48b7991ca5","resolution":{"observed_at":"2026-08-07T05:03:26.307343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T05:03:26.372345Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.372345Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:7e021003b7ef8a222df48b5fe843cc0d9860134708b902bf782cbe944ab6e5c5","observation_id":"12a9a868-d0cd-4408-b1a8-34f7e025060a","resolution":{"observed_at":"2026-08-07T05:03:26.372345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12809","last_updated":"2023-06-18T02:13:46Z","snapshot_observed_at":"2026-08-13T13:14:42.364906Z","submitted_at":"2022-12-24T19:46:47Z","title":"Understanding the Complexity Gains of Single-Task RL with a Curriculum","version":3},"cited_work":{"arxiv_id":"2212.12809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.12809","snapshot_observed_at":"2026-08-07T05:03:34.296282Z","title":"Understanding the Complexity Gains of Single-Task RL with a Curriculum","venue":"cs.LG","work_id":"f74091d2-676d-4d46-bbeb-cac5e9ba5b42","year":2022},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.430721Z"},"links":{"cited_paper":"/paper/2212.12809","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c4213df580843bd87e1737cec59653890b248698666d47909cacd91f84397c09","observation_id":"6951c05a-5e10-4317-a2a4-0976c4bd09f1","resolution":{"observed_at":"2026-08-07T05:03:34.373383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-08-13T00:39:10.515138Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-07T05:03:26.464454Z","title":"Long-context llms struggle with long in-context learning.arXiv preprint arXiv:2404.02060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.464454Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ffcc370aa7af5a5bd9f42a8d42972118a9c18c2de00ec80ff503d2b0d66dd898","observation_id":"0473c9c2-a41b-4010-bf25-5fd125a256b7","resolution":{"observed_at":"2026-08-07T05:03:26.464454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05896","last_updated":"2020-07-12T03:33:50Z","snapshot_observed_at":"2026-08-09T02:38:46.546067Z","submitted_at":"2020-07-12T03:33:50Z","title":"Learning Abstract Models for Strategic Exploration and Fast Reward Transfer","version":1},"cited_work":{"arxiv_id":"2007.05896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.05896","snapshot_observed_at":"2026-08-07T05:03:34.030351Z","title":"Learning Abstract Models for Strategic Exploration and Fast Reward Transfer","venue":"cs.LG","work_id":"916ae297-4e6f-4a01-a132-84bef8cd4718","year":2020},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.505425Z"},"links":{"cited_paper":"/paper/2007.05896","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:1e03119f287a5fbfd298cff77976e23482f3596c95e69606170924d3be85d744","observation_id":"b2d64ab7-2198-4b1c-a6c5-4b0a9ea16206","resolution":{"observed_at":"2026-08-07T05:03:34.135617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-07T05:03:26.538629Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.538629Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:a03eec6a2da0032e8f591bebc2f98925b1743d7891a77a42f5cc01b13dc9d695","observation_id":"cfe38482-8f06-465a-97f4-0d92e1ae9e09","resolution":{"observed_at":"2026-08-07T05:03:26.538629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T05:03:26.569626Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.569626Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:bf7265075240d8051a61131977a61a4f3655d3f5907ac2f4637dbb693632a96e","observation_id":"327cfcbf-ed19-48cf-9796-ee89fe80cad3","resolution":{"observed_at":"2026-08-07T05:03:26.569626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.638436Z","title":"Acemath: Advancing frontier math reasoning with post-training and reward modeling.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.638436Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6d61484e822093f24bb31e655b61049416ead87c5276896dba0ed0c3cbdd6beb","observation_id":"09b53ecd-4144-419a-8716-247b70a4f766","resolution":{"observed_at":"2026-08-07T05:03:26.638436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.690066Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.690066Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d8e25190e42b7da28a4cad8c739893be77f12dd4a9ee42726bbc1ed2d404b3ca","observation_id":"92b2fbf2-884b-45a3-b961-3db8c7a8d3c7","resolution":{"observed_at":"2026-08-07T05:03:26.690066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.747061Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.747061Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4fc15fbfd22e220827868e9bb5a31158a2cb7a454bd5a7519187fa4ec17f610c","observation_id":"e4aa8473-3a95-48d6-8c14-8069af19c0fa","resolution":{"observed_at":"2026-08-07T05:03:26.747061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.842800Z","title":"s1: Simple test-time scaling,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.842800Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c7749285f959ca02773bd91dd84ab9e6e037a8abc8f0ffebd8269c297a1008dd","observation_id":"10aa9ec4-ba0e-43c5-90e6-19807c442f98","resolution":{"observed_at":"2026-08-07T05:03:26.842800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-08-12T22:27:57.136902Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-07T05:03:26.952530Z","title":"Evolve: Evaluating and optimizing llms for exploration.arXiv preprint arXiv:2410.06238, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.952530Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:414a9530e82809add410a16c7fcf7096c6f2ebf14709eb0d9d32e4edccd00b0b","observation_id":"52911944-a89a-47e7-ae74-3accc39b8d79","resolution":{"observed_at":"2026-08-07T05:03:26.952530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:03:26.907112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.907112Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:2900c7ea6666fd468167d0af0f627eb54987c9e7c8bec4ca1c52051f2264b222","observation_id":"c22a6a3f-f6ff-4d52-b80b-d5f983955527","resolution":{"observed_at":"2026-08-07T05:03:26.907112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-09T07:55:48.130608Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-07T05:03:27.075191Z","title":"Maximizing confidence alone improves reasoning.arXiv preprint arXiv:2505.22660, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.075191Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:04970ab8ae6c55676d81cb7811f94809ce8dd44efb6daa7588efb756ecd5552c","observation_id":"a5ee57e0-46a5-4534-b3f4-40b377ee033f","resolution":{"observed_at":"2026-08-07T05:03:27.075191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:03:27.026991Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.026991Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:fd525ff586622759ff1b2c9a89660c7e8f7452ffe3031edf825c5b43af5b93fd","observation_id":"7788e3dc-c34d-47d8-9433-c4febbdd1c91","resolution":{"observed_at":"2026-08-07T05:03:27.026991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.114011Z","title":"Optimizing anytime reasoning via budget relative policy optimization.arXiv preprint arXiv:2505.13438, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.114011Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:f5a50d79be98d8d7cdd1992ee242cf148b037bb00168db6543ca18be74cfe60d","observation_id":"9501d6f4-81d4-425f-9b26-ef0835d084cd","resolution":{"observed_at":"2026-08-07T05:03:27.114011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.081368Z","title":"John Wiley & Sons, Inc., 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.081368Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c59f1384ba33331e5e3f0bbd0de0d27c633110387918e893d0467e501f242503","observation_id":"82baf72a-03f8-433d-926d-851f97505323","resolution":{"observed_at":"2026-08-07T05:03:27.081368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-10T14:40:38.654692Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:03:27.410502Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.410502Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:cbb4c3e30d40ca9993f36fd555cf6fcf207ab506285c570e6abb89bcd6b80298","observation_id":"83245270-4548-4a11-8767-ddf00921963f","resolution":{"observed_at":"2026-08-07T05:03:27.410502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-12T23:14:40.641743Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-07T05:03:27.330777Z","title":"Recursive introspection: Teaching language model agents how to self-improve.arXiv preprint arXiv:2407.18219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.330777Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:9cababb62ebaeb7ec29026d000dc1ac283bc6f1e7247a46aa6fd61846d83ab39","observation_id":"93881a94-72c1-4b83-815f-b6aa2f1a469a","resolution":{"observed_at":"2026-08-07T05:03:27.330777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T05:03:27.538173Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning.arXiv preprint arXiv:2410.08146, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.538173Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4d78db503fc44fc52958c133959fc6b3226ea398df9b93a11df4b51b4a3332c5","observation_id":"1782b1e6-2e5d-4e88-bd43-c2cc14ef8572","resolution":{"observed_at":"2026-08-07T05:03:27.538173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:03:27.481185Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.481185Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b41c0cc0572d982ebec723cca40af73289de762cad1a013479c9d0dd32bd6bea","observation_id":"7082dd8b-ab49-4565-b43e-4b6fa9fd41ce","resolution":{"observed_at":"2026-08-07T05:03:27.481185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-10T14:41:12.777450Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:03:27.653994Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.653994Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:02c032c1b314377acbb4a45116a7a5f4ad3411818aeaf97e25f19633afbc6ced","observation_id":"d155d0d9-b405-46c5-9231-8f57d771e0eb","resolution":{"observed_at":"2026-08-07T05:03:27.653994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.601303Z","title":"Opti- mizing llm test-time compute involves solving a meta-rl problem.https://blog.ml.cmu.edu/,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.601303Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:aed23e951517f0aceb8bec27bccd676e6afb58d1bd1507020ffe27772a521a28","observation_id":"8ba954c4-8f3f-4ec8-8b34-bcad6404e7b1","resolution":{"observed_at":"2026-08-07T05:03:27.601303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.887825Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.887825Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0e67ae9db22c3f21413e0d56b191e6ffe1eeef4d22a9c214af0d1ec2f76ff90b","observation_id":"93354397-44c3-457a-8c2b-ad6a5463736c","resolution":{"observed_at":"2026-08-07T05:03:27.887825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.763477Z","title":"Can large reasoning models self-train?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.763477Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6e4b87544ed335766955a632190d3c98ebb108207d6333c4585d0f3da51db2bf","observation_id":"aed5a159-d96f-420e-8049-51292198c6ff","resolution":{"observed_at":"2026-08-07T05:03:27.763477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:03:28.093876Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.093876Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:bf3daee92fba5162578970c72d15766e4f379f6d5f083554bd87df8ffa8d37ce","observation_id":"f28761a3-3781-4ea6-ba56-de81838ac795","resolution":{"observed_at":"2026-08-07T05:03:28.093876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:03:27.977837Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.977837Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:dffabd6e7472a2a768f7459df5f3c9da0b6722e97e4d5e01a41264fc306fe8df","observation_id":"d72ebdd1-a06d-45cf-ae99-5f5e48a5f708","resolution":{"observed_at":"2026-08-07T05:03:27.977837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T05:03:28.325951Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.325951Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:93b1ac1d1fb537e9c331b3b9dd7d89000799940d7d849700f0179c185c6080b8","observation_id":"3773da43-37af-48b7-9350-02da630331d1","resolution":{"observed_at":"2026-08-07T05:03:28.325951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-07T16:07:46.182926Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-07T05:03:28.240528Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.240528Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:966758ae5e5ec478eccc5707b92399d30f8766ec9f1e7ddfdc131480f66dc511","observation_id":"207ae8f2-58cf-4814-a505-d16add4c7125","resolution":{"observed_at":"2026-08-07T05:03:28.240528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-08-13T04:47:08.775275Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T05:03:28.528670Z","title":"A minimax- imalist approach to reinforcement learning from human feedback.arXiv:2401.04056, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.528670Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:12201dc2da8a26cc7b56b79869a5afd4469b85a6d7453f4292643879d1153fc5","observation_id":"d722aab7-75a3-4e2c-b6c7-a7e5fb01397f","resolution":{"observed_at":"2026-08-07T05:03:28.528670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02674","last_updated":"2025-02-25T16:59:11Z","snapshot_observed_at":"2026-08-11T23:09:04.859107Z","submitted_at":"2024-12-03T18:47:26Z","title":"Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02674","snapshot_observed_at":"2026-08-07T05:03:28.400160Z","title":"Mind the gap: Examining the self-improvement capabilities of large language models.arXiv preprint arXiv:2412.02674, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.400160Z"},"links":{"cited_paper":"/paper/2412.02674","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:a80c50fc7e9bfe7b4108b97171c18369e1b16a33e619698238c21b3b26115b63","observation_id":"b760d7ee-a2d3-4a3e-a999-b4747dad6391","resolution":{"observed_at":"2026-08-07T05:03:28.400160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:28.718332Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data, ICML 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.718332Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:a4a52a1de285ae50fc448fd05b06338714ed97323b534e8da217fcecc3f4566b","observation_id":"41efc73e-f3a3-4f0f-a89c-97b4007aa361","resolution":{"observed_at":"2026-08-07T05:03:28.718332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:28.616812Z","title":"All roads lead to likelihood: The value of reinforcement learning in fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.616812Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:cd6c5466675f76a547fd6e7da47dd964432bc7dbf14e787b0a47656266a37a0d","observation_id":"014f4051-8c67-462c-929d-4f6ef5cb1548","resolution":{"observed_at":"2026-08-07T05:03:28.616812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:28.890910Z","title":"Open Thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.890910Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:e3a839ccbc485d57b62ba38696305ebed9ee5e37043672b0b49fa4a3a0de4f64","observation_id":"741f74ff-94a1-47c6-a190-cdf584061006","resolution":{"observed_at":"2026-08-07T05:03:28.890910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:03:28.800270Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.800270Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:7184ed2ca300c4c198e8dcf375dde9a831b06aeddd500469c98b199d371bb1a4","observation_id":"878ef22e-f7fb-4336-9912-49ecb9b789eb","resolution":{"observed_at":"2026-08-07T05:03:28.800270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T05:03:29.161726Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.161726Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:3a86e73cca771103c0f4dfaab0e7a281837de6efb1bdc323680ff8a762a158fe","observation_id":"f835cd85-0c80-4003-b734-4115945c1f75","resolution":{"observed_at":"2026-08-07T05:03:29.161726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-13T06:08:42.070209Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-07T05:03:29.029441Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning.arXiv preprint arXiv:2506.01939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.029441Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:55b90eb5c63fb85f44db28a56e91ee71b2a7fc07d8dd4a73b7e92b5620c0e73d","observation_id":"86ac5cef-66ee-4c4d-9405-8c67ec8399ff","resolution":{"observed_at":"2026-08-07T05:03:29.029441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T05:03:29.367441Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.367441Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:40d6ca8472e971d9627a45a10d67477a6cfb04848f742025b38a78b1497e15f1","observation_id":"f0eaa6fe-7121-44d7-a84b-6ce3418d5c79","resolution":{"observed_at":"2026-08-07T05:03:29.367441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T05:03:29.284245Z","title":"Reinforcement learning for reasoning in large language models with one training example.arXiv preprint arXiv:2504.20571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.284245Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:e78bf330a52621be101265cd94182d821750a2d9e5434019ef4934cff5eb414f","observation_id":"da1e103d-0c2b-46f9-9ec7-68d171daa5b5","resolution":{"observed_at":"2026-08-07T05:03:29.284245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T05:03:29.615178Z","title":"Tree of thoughts: Deliberate problem solving with large language models.arXiv preprint arXiv:2305.10601, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.615178Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4260721f40427db5ceeed071127d721f16bae4bbfd742dd586e869e6f2e4bf8c","observation_id":"9f9f2196-f3c0-4924-9bb5-06e05a112b7d","resolution":{"observed_at":"2026-08-07T05:03:29.615178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T05:03:29.500826Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.500826Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:94583ec1200a776355ad1f1ea204c554b32ceb01fb3aacf89f9e21dea9398451","observation_id":"968c06be-1c7f-4e33-a8d9-a2e465a1f2d2","resolution":{"observed_at":"2026-08-07T05:03:29.500826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:03:29.861106Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.861106Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:7327a41b41e9d10f6bb5962bc2e801ca9f13518d78b23158749d177b79e7cb26","observation_id":"8b61a26d-890a-4211-83ab-ee5887694417","resolution":{"observed_at":"2026-08-07T05:03:29.861106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T05:03:29.742448Z","title":"Demystifying long chain- of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.742448Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:a71a53f1df2b2d402f4487312c034c53b654742081d384d12327cfde786eb79a","observation_id":"fbe2ba65-17b0-4fc9-a82c-421acd9a1363","resolution":{"observed_at":"2026-08-07T05:03:29.742448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T05:03:30.047432Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.047432Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:9e237aa54315154c63db44d41b1e8071018d87c05fe15ed3d1235b2cecd41f56","observation_id":"26d30ab5-fa15-4fc6-bc30-355c07bb69e5","resolution":{"observed_at":"2026-08-07T05:03:30.047432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-13T12:20:57.788212Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T05:03:29.931120Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.931120Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b2b47820b75c384ffa9bbf30f126f4bfebdeff2cea3a609afeea54aeb74b3217","observation_id":"233747cc-2482-4e80-a50b-534029d8f11f","resolution":{"observed_at":"2026-08-07T05:03:29.931120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:30.153724Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.153724Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:a67d07ccef48ad3c7b68e0d55e440cf5c45462f5e3f000da7922986debef13e6","observation_id":"5f7f6153-5475-49de-8a4c-b66f7025612a","resolution":{"observed_at":"2026-08-07T05:03:30.153724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-07T05:03:30.482279Z","title":"reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.482279Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:951785885145f9658a838ccde6fd7535c79ec5200311921b442fb96d57bde2ad","observation_id":"5d7413e4-ec3c-41e5-866f-878829bce260","resolution":{"observed_at":"2026-08-07T05:03:30.482279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T05:03:30.353983Z","title":"Simplerl- zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.353983Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:2155e33a5881e8b7109463d54718d0a7223954d552d9b1a60036105743abb00d","observation_id":"6d5d42ea-cccc-42f2-9151-fa579a2a658d","resolution":{"observed_at":"2026-08-07T05:03:30.353983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:34.879322Z","title":"Looking at the other numbers: 77 - 70 = 7 97 - 73 = 24 (interesting, we already have","venue":null,"work_id":"c5c71ba2-e250-4844-ab65-1c5e816ec2cf","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.298133Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:9814983fba25f2aac4d306642bbcab0b79910e7bd537450b59166882f0c04054","observation_id":"d8b24c0e-a7a5-4ddb-bdfa-0e4246605f7a","resolution":{"observed_at":"2026-08-07T05:03:34.993578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:40.613658Z","title":null,"venue":null,"work_id":"e750b564-1296-4f0f-9f64-bfd2a7c64551","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.603388Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:905e5bed8cdfab7eb39ced479b0089737abb81692b1ee9cc541cfc03a252e29d","observation_id":"73793d47-d65d-4c6b-be67-7ad5aa220217","resolution":{"observed_at":"2026-08-07T05:03:40.735256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:40.397426Z","title":"We need to get from 37 to 466, which means we need to multiply by 12.5","venue":null,"work_id":"c8cbe06c-3eb1-477f-9a71-0a28346f9cde","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.705279Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0e9fe41120591686a396f31a90ff7c78d1b2af9013ce6e876052a67c4edd6602","observation_id":"16ec9fdc-ddb2-4d41-8eec-2bc04cbf672b","resolution":{"observed_at":"2026-08-07T05:03:40.511892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:40.197661Z","title":null,"venue":null,"work_id":"044afcce-fd62-4787-a2c3-923afa2a7874","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.826305Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:2ce37c056f493067d5747472e81b6401eb4e74bdcf2748920b32755dc396184b","observation_id":"cba0c388-9ba8-48ee-91d6-0e00a7c42aaa","resolution":{"observed_at":"2026-08-07T05:03:40.298433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.984330Z","title":null,"venue":null,"work_id":"1e3ad36e-1c25-462c-866f-446bf56b60b2","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.947729Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:26d06cb624dcf63cf46553677120af001572aa26ccd88d1208e6a8e15a27abf5","observation_id":"7703ae3e-ae22-45dc-a9ec-624e83181129","resolution":{"observed_at":"2026-08-07T05:03:40.090080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.775175Z","title":null,"venue":null,"work_id":"b5fc1195-7d18-4a95-99b1-334d84174940","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.064851Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8a531e4b5abd831bd2b576e890ced1a025001fe515a5657ca655f3cf5bf14f9f","observation_id":"38c15b0c-bec0-4193-848a-65acd990faf9","resolution":{"observed_at":"2026-08-07T05:03:39.898527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.534070Z","title":null,"venue":null,"work_id":"f364c4e3-ae85-4dad-b519-a5e8d30e2c1d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.157389Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b3ea73e41486581fdd1677cebe781401d2b778c410e8d3afca6a6134c41fbbe6","observation_id":"2b8878db-da0e-463d-b3f2-5872b395b83c","resolution":{"observed_at":"2026-08-07T05:03:39.646657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.349533Z","title":null,"venue":null,"work_id":"ecf5ad2a-36fb-48b9-b63d-fbfc93902027","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.247123Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:fb6530a55965284218722a91def2382688cdcccf73fe5d71e9700e96d5993bfb","observation_id":"48455646-a978-45c3-8a4c-22f364a55508","resolution":{"observed_at":"2026-08-07T05:03:39.438320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.100239Z","title":null,"venue":null,"work_id":"19ab7408-3085-452e-971c-87f3dbee3a12","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.382722Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:881e35ef0dbad7a7bfa1813e50eceda4082d7f1708117af1390f4b8b4b21f4ab","observation_id":"bcb27548-26d4-4336-8b9f-2c7770a86ee7","resolution":{"observed_at":"2026-08-07T05:03:39.216261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.928827Z","title":null,"venue":null,"work_id":"4210c466-0b0f-499d-bd69-e62dc21bd59d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.517583Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d73f826edb35095483e1b1f5a68b5d55d46d096aeaa9f9b2954224df2d7bc8d7","observation_id":"a42f1119-c124-4ced-840f-64137e979db0","resolution":{"observed_at":"2026-08-07T05:03:39.009793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.782657Z","title":null,"venue":null,"work_id":"f73104f7-4a95-4442-9598-9fa14f2bb2ee","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.600499Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:50a1196a8d7532982c9631652f55a502299e71f57c8d7d6fab0e9babea19791d","observation_id":"66d47b82-d388-4183-a294-7b9d7472290d","resolution":{"observed_at":"2026-08-07T05:03:38.877821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.524859Z","title":null,"venue":null,"work_id":"7e3240ae-113c-41cb-8458-f07a8297360d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.690026Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c834f2c9d13f0fd838ce44e32976cc968defbd63aa9e975b7eff11a25707990a","observation_id":"476391ed-9599-46d5-ac75-e69fa5892a14","resolution":{"observed_at":"2026-08-07T05:03:38.657484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.295934Z","title":null,"venue":null,"work_id":"8023548e-c2c8-47e6-9a27-8f333e748a0d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.769004Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:24b2a3ef3d3a52c12e1de9054767d6c8892cea639f3c0d6ce6458e7ab71dcf1c","observation_id":"7f1d463a-e987-489c-99e0-3e57a75edd6e","resolution":{"observed_at":"2026-08-07T05:03:38.408750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.045224Z","title":null,"venue":null,"work_id":"b1ea87ea-077c-43e3-b517-7dda2b3052c7","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.928589Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6723186f3e5b1a150a1b3ab8451d4c86fe35942ad8c694eddc8005a2dd222572","observation_id":"75ba2295-f46d-4876-a35b-e71b4b53bfff","resolution":{"observed_at":"2026-08-07T05:03:38.133653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.838165Z","title":null,"venue":null,"work_id":"bb5b9a53-57e7-4554-87f5-06d7a42d7e1f","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.068744Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0e7bc34bd2d0fc356fc6c85b498e702f251bccba727a20a7f90f9ecaa1f447a0","observation_id":"66dfd81e-85ea-4ea7-bdde-1fa303f6a108","resolution":{"observed_at":"2026-08-07T05:03:37.931265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.623360Z","title":null,"venue":null,"work_id":"af099457-1e81-4dea-8574-5acf8490a235","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.154019Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:a8438a6e757f3a98b23edeab6d302a23dd3e007e5437bc5d490ac2e0b3f2a2b1","observation_id":"b2e2a2a8-3ad0-47ab-9d10-8fe797d320e0","resolution":{"observed_at":"2026-08-07T05:03:37.716974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.388576Z","title":null,"venue":null,"work_id":"93f7cb7e-a6fa-478d-863f-ac63c9e66bdf","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.248190Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0763dccdaa3208fdfcf03b95a2c6d08794a95c57bb37921639bc11a5ba787504","observation_id":"884f3572-8433-4f42-9e4b-22f75dd0c333","resolution":{"observed_at":"2026-08-07T05:03:37.520483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.201597Z","title":null,"venue":null,"work_id":"5502ebe3-a6ec-4383-9310-10344ddc43ed","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.343942Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:1624f3e7e040615130458107946cdf604bf136a5288fb0db51c87021a55467b5","observation_id":"437b83b2-677a-4490-8b68-89b6d5c1cd3c","resolution":{"observed_at":"2026-08-07T05:03:37.291156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.955018Z","title":null,"venue":null,"work_id":"92cfbe98-2ceb-4429-9abb-c55a1d769385","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.446315Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:42a0a9bcc3b9d2978301f38ca72fbd1a36947f321a0a2366c316f261248707d5","observation_id":"269eedb9-3091-40f7-8272-7aefe649550e","resolution":{"observed_at":"2026-08-07T05:03:37.088649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.711796Z","title":"31.5 (not helpful)","venue":null,"work_id":"2e686b89-89d0-4195-9c38-12fe853a0907","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.586951Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b1f40e14fd3f313941a6bfbf59ecde885c5c00159a4585f380913077120cb458","observation_id":"3c5a907d-1706-4adc-88f4-31f4dc9dbfbd","resolution":{"observed_at":"2026-08-07T05:03:36.816490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.446167Z","title":null,"venue":null,"work_id":"3a7de96c-34a0-4a10-a9ff-7c96d7f090c7","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.661655Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4b30ffbb3eacc9fcc0450d98515440b6b882dee987d44f13b33685c48422e3ec","observation_id":"7db092d6-5cdf-4905-bf33-b562e09ffb1b","resolution":{"observed_at":"2026-08-07T05:03:36.569151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.219769Z","title":null,"venue":null,"work_id":"7eef341d-0efe-4681-8a97-7dff45ca13fe","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.768424Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:777344cc5eeaaa09d2c871eaa25f82e19b78bb997f19e87330ca1f363e0c766a","observation_id":"cd6f2c5d-3087-473a-85c4-ca16269bc216","resolution":{"observed_at":"2026-08-07T05:03:36.358782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.024239Z","title":null,"venue":null,"work_id":"688a295d-f2c4-41a9-b21f-9c8f39626b31","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.882107Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8e9d6df78d7715b0919dc60e38c3cc8a9535cb1f57375a0d273602549c0fbab1","observation_id":"8fa66cf5-8f1c-40b3-b0a2-9e5cf583b650","resolution":{"observed_at":"2026-08-07T05:03:36.118343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:35.711588Z","title":null,"venue":null,"work_id":"7d9845e0-b422-4d82-b48e-ed88764fbc25","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.007560Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:49a7e403a287caea9cd334c7417dcf65889ced459f153171396c6e6f1909d5a7","observation_id":"2efbcaa7-2bed-4693-941a-5eb70b13dbd1","resolution":{"observed_at":"2026-08-07T05:03:35.933890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:35.450239Z","title":"Hmm, let me think about how to approach this","venue":null,"work_id":"76051158-331e-42e1-b772-776e9dff6410","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.139220Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d3f23dea897e092dc3ac1760bacfd87fbe8a14a477ab3046ec5a94d702ac77e0","observation_id":"415a2322-a148-4db3-849e-c71a98eef83b","resolution":{"observed_at":"2026-08-07T05:03:35.609076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:34.653935Z","title":null,"venue":null,"work_id":"65b63f16-6d48-4eee-8c7a-6ac7248db84b","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.393958Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:08856519adb5fdad5086ccb556579f6ee088badedead8d249bcaf55d4a2d0977","observation_id":"9759744a-aa27-460a-9737-6bad422b14a8","resolution":{"observed_at":"2026-08-07T05:03:34.743229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:35.165723Z","title":"Again, multiply 347 by 5 and add two zeros","venue":null,"work_id":"85d0c7f3-0b15-4e81-a142-deb23741ad6a","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":500,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.212215Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:5f1aef467994201e73a60f6c0fe83ef501cb475e7a7eea7fd1b185f73b27b1ee","observation_id":"e8a353ca-341f-4290-925d-faf4647054df","resolution":{"observed_at":"2026-08-07T05:03:35.287512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:03:25.469591Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.469591Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:74656bc1947592a647868eefb158451c799c81e16021f496f5c2c5b9523f84e1","observation_id":"7ca58a45-cbde-464b-9c44-32b754e36ef5","resolution":{"observed_at":"2026-08-07T05:03:25.469591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":85,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 12 inbound Pith citation observations for arXiv:2506.09026."}