{"as_of":"2026-08-09T14:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8406aea340d01d08a796cd6e746902f23f8d26c84f453879dd7af80b340138ac","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T00:27:17.680587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:45:55.622776Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T20:53:45.878221Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2406.06592"},"observation_digest":"sha256:270d74e40e2ab0977986be50d399abf71bbe78515a40a318a39cfb6d9d3e3e5b","observation_id":"2d718454-7d82-4fec-81f0-200f2633fc22","resolution":{"observed_at":"2026-05-13T20:53:45.987128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":185,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:3ea114740fca64eef772524fce578dc4803ec000fedd511b42f62ce66b1d8783","observation_id":"fdc81c39-977f-4985-87d5-629e578dcf47","resolution":{"observed_at":"2026-05-15T21:20:59.421827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-09T00:27:17.680587Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04404","last_updated":"2025-02-06T08:52:43Z","snapshot_observed_at":"2026-08-09T00:20:19.377517Z","submitted_at":"2025-02-06T08:52:43Z","title":"Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T00:27:17.680587Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.04404"},"observation_digest":"sha256:8689b2752a5911f2480557313849d0e58079bf47819d15fa4c626c5c96862133","observation_id":"1ec4b393-0e04-4406-a39f-d5adf40228bc","resolution":{"observed_at":"2026-08-09T00:27:17.680587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-08T21:40:26.993871Z","title":"arXiv preprint arXiv:2406.03816 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04751","last_updated":"2025-02-07T08:36:39Z","snapshot_observed_at":"2026-08-09T03:57:00.818497Z","submitted_at":"2025-02-07T08:36:39Z","title":"Holistically Guided Monte Carlo Tree Search for Intricate Information Seeking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T21:40:26.993871Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.04751"},"observation_digest":"sha256:868fe4dce6131d5f8d0756c74c183b73403af9995f8e3247b62294b5fa05e926","observation_id":"19cb2dbc-c86d-4fa6-aa64-4abbd030d2d6","resolution":{"observed_at":"2026-08-08T21:40:26.993871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-08T18:10:53.446974Z","title":"Mario eval: Evaluate your math llm with your math llm–a mathematical dataset evaluation toolkit, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-09T13:54:38.102857Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.446974Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:95aa3162c08966082d617303c9d70fb85680803100aa82f117a8a66c7d668231","observation_id":"2c915cf3-30ac-4f5a-a29b-5b1223555aed","resolution":{"observed_at":"2026-08-08T18:10:53.446974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-08T14:25:53.635679Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06773","last_updated":"2025-02-10T18:52:04Z","snapshot_observed_at":"2026-08-08T22:57:17.515334Z","submitted_at":"2025-02-10T18:52:04Z","title":"On the Emergence of Thinking in LLMs I: Searching for the Right Intuition","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T14:25:53.635679Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.06773"},"observation_digest":"sha256:fec0dced225f08db1a880c586c1273d5e41c5051dbb91e49dfa00c6c5b43c6df","observation_id":"e4199f7f-f4b0-424c-8252-8677147d40fd","resolution":{"observed_at":"2026-08-08T14:25:53.635679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:83472709cea8576f9edd00abd20c8a2abb28152059dbbebcad3850a98b1c5cdf","observation_id":"d9fb5c6d-7ef9-4cc8-9766-d999c3b3bc77","resolution":{"observed_at":"2026-05-13T01:36:24.208820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:6adabf760b34f336dcd3ec43de656cf2ae18f921dddc1d40960ee4f1f42129e0","observation_id":"db777363-2f3f-434a-b00f-222e6d3c1778","resolution":{"observed_at":"2026-05-16T15:04:22.788835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T15:38:50.099971Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-07T18:18:03.761893Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.099971Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:72b918157601099856d0f89af90608c5a0ced8a7565b967a001028cdc8759f62","observation_id":"5ab26c4c-3faf-40a7-a2b6-f62068ae0116","resolution":{"observed_at":"2026-08-07T15:38:50.099971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T15:01:53.041020Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024a.URL https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16582","last_updated":"2025-05-26T10:07:05Z","snapshot_observed_at":"2026-08-08T23:24:39.055718Z","submitted_at":"2025-05-22T12:17:13Z","title":"O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:53.041020Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.16582"},"observation_digest":"sha256:2824165b9122667162ef115c36ec3ac9e3a30a6ba7118191d3925f4f8b43482e","observation_id":"657dc109-a0cd-412b-860d-200919d6f8d1","resolution":{"observed_at":"2026-08-07T15:01:53.041020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T13:10:45.635718Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.635718Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:5b8a5e83f3f61070d00b7e8a9169fe43422e38f360c00fd9e13c71d7ed50b1e8","observation_id":"8f62cfd8-7bdb-4bc1-b40d-e42e352344dc","resolution":{"observed_at":"2026-08-07T13:10:45.635718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T10:56:23.724916Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03978","last_updated":"2025-06-09T04:15:05Z","snapshot_observed_at":"2026-08-08T01:31:04.404758Z","submitted_at":"2025-06-04T14:08:44Z","title":"Structured Pruning for Diverse Best-of-N Reasoning Optimization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:23.724916Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.03978"},"observation_digest":"sha256:607b4b37cdccc6f7e84be9e00a5d0b0be9562ca1d05012a6c328788f8fd8794f","observation_id":"b468fc3c-b25a-4c5b-9425-e2a8afe5b8c3","resolution":{"observed_at":"2026-08-07T10:56:23.724916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T05:36:38.545811Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07551","last_updated":"2025-06-12T07:30:27Z","snapshot_observed_at":"2026-08-07T22:38:32.445079Z","submitted_at":"2025-06-09T08:41:39Z","title":"CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:36:38.545811Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.07551"},"observation_digest":"sha256:c883511a05200dcdd1579b8e66bb79cdfb21307d1406b6332e5b594bf67ea8a1","observation_id":"cc91fd04-9f02-4dc1-80dc-a1c9320020f8","resolution":{"observed_at":"2026-08-07T05:36:38.545811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T05:09:23.240182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-08T00:05:08.877544Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:23.240182Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:c7e6fbcb533d82a36a5d2e70c2d5561e85098fd42b485db27a1c0306789a2409","observation_id":"f4a3a9e7-5c69-4fc8-bffa-56f9115de103","resolution":{"observed_at":"2026-08-07T05:09:23.240182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T01:08:25.265647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:25.265647Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:67d1bbd775359bce853ca0a250ee054551007e8dbc72aa05134ae729e516b31a","observation_id":"835d2202-c34e-47ce-8dd7-cbb7280c706c","resolution":{"observed_at":"2026-08-07T01:08:25.265647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-06T23:03:54.490103Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19967","last_updated":"2025-06-24T19:31:03Z","snapshot_observed_at":"2026-08-09T06:56:12.667532Z","submitted_at":"2025-06-24T19:31:03Z","title":"Inference Scaled GraphRAG: Improving Multi Hop Question Answering on Knowledge Graphs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:03:54.490103Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.19967"},"observation_digest":"sha256:d79cfdb877e66ef9c4b1e1124a99fa07fef3d81319f9b83412559787909ddc67","observation_id":"e9bd3714-6d04-4bae-b32b-264eec0dba3e","resolution":{"observed_at":"2026-08-06T23:03:54.490103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-06T22:30:16.296100Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21497","last_updated":"2025-06-26T17:26:17Z","snapshot_observed_at":"2026-08-09T04:48:54.629381Z","submitted_at":"2025-06-26T17:26:17Z","title":"Enhancing User Engagement in Socially-Driven Dialogue through Interactive LLM Alignments","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:16.296100Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2506.21497"},"observation_digest":"sha256:fc3edb60248157553515b3c8691dbe3b354400f6736938e400aacfed4a4ce237","observation_id":"5be8b77b-eb10-4589-9779-57bf1ac7d3d4","resolution":{"observed_at":"2026-08-06T22:30:16.296100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-06T18:04:55.263407Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09374","last_updated":"2025-07-12T18:44:32Z","snapshot_observed_at":"2026-08-07T21:26:10.688337Z","submitted_at":"2025-07-12T18:44:32Z","title":"EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:04:55.263407Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2507.09374"},"observation_digest":"sha256:b424a8b9b480bcba8685c3fb311facf27fa81b74a1fd900f56697a1923f94bee","observation_id":"60d23114-b4cc-4d04-a3e8-356b4f0a3d6f","resolution":{"observed_at":"2026-08-06T18:04:55.263407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-05T04:42:06.478842Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.arXiv preprint arXiv:2406.03816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.478842Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:574b12597db0ae3a09a7a82c6a210aa85cedddd71644dd72fd8677e6e29a155f","observation_id":"4404c5fd-2fa1-423a-a3b1-419b3d1c9fc1","resolution":{"observed_at":"2026-08-05T04:42:06.478842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-04T06:40:27.771393Z","title":"Rest-mcts*: Llmself-trainingviapro- cess reward guided tree search.ArXiv, abs/2406.03816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-07T08:51:03.458621Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:27.771393Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:69002e9ea36674183358d048dadfd7b9bf0ee590f1b9abf3b28630a5cc4673e3","observation_id":"55537287-1e32-4ea5-97b8-a6533ee96552","resolution":{"observed_at":"2026-08-04T06:40:27.771393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2604.10827","last_updated":"2026-04-12T21:49:13Z","snapshot_observed_at":"2026-08-05T18:01:30.449144Z","submitted_at":"2026-04-12T21:49:13Z","title":"Your Model Diversity, Not Method, Determines Reasoning Strategy","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:30.448400Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2604.10827"},"observation_digest":"sha256:a31741707784134cc10606d5d4e89376313f6d56d5a0671eb024089f4bd73fbe","observation_id":"96cc5f10-7a1c-42e7-95eb-358b94a1a8c9","resolution":{"observed_at":"2026-05-11T10:56:02.754586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2604.18327","last_updated":"2026-04-20T14:29:08Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:29:08Z","title":"PARM: Pipeline-Adapted Reward Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:26.015817Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2604.18327"},"observation_digest":"sha256:05c6252d19814d047053ceefc9ee9b9645ab4b1fd59b4ca215e430a67699cc8a","observation_id":"6856d430-8a02-4ba5-a41e-b32e1038547c","resolution":{"observed_at":"2026-05-10T09:28:39.512713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2605.03625","last_updated":"2026-05-05T10:55:18Z","snapshot_observed_at":"2026-08-02T11:13:43.003711Z","submitted_at":"2026-05-05T10:55:18Z","title":"Self-Improvement for Fast, High-Quality Plan Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-07T04:13:17.612428Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2605.03625"},"observation_digest":"sha256:73653951111edf0930f88af180bc20176ce2733aa7513045ef4e9c10af5f0ce5","observation_id":"77e634fa-d469-4914-96f5-b82c1ad7af7e","resolution":{"observed_at":"2026-05-12T10:41:30.662509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2605.05262","last_updated":"2026-05-06T06:17:48Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-05-06T06:17:48Z","title":"Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:16:00.499779Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2605.05262"},"observation_digest":"sha256:bc58508d7fb75704c585ad6ca8c3ec2db3b05a08ef1c55085fd09f848399c59a","observation_id":"96f5121e-c87d-416a-abe8-776e950c0f9c","resolution":{"observed_at":"2026-05-11T17:46:06.893478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2606.00618","last_updated":"2026-06-23T11:36:28Z","snapshot_observed_at":"2026-07-06T23:41:19.955034Z","submitted_at":"2026-05-30T08:46:44Z","title":"Efficient Test-time Inference for Generative Planning Models with OCL Search","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T18:53:08.784890Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2606.00618"},"observation_digest":"sha256:6489e8de56aa07eb74b536831fdbcede053697d5824bff9b00cc2fe6e62411b5","observation_id":"3141565e-11ba-4c49-99e7-97baa43cf0d9","resolution":{"observed_at":"2026-06-28T19:52:35.134640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2606.05464","last_updated":"2026-06-03T21:43:38Z","snapshot_observed_at":"2026-08-03T10:19:08.677126Z","submitted_at":"2026-06-03T21:43:38Z","title":"Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T05:46:26.938277Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2606.05464"},"observation_digest":"sha256:a184f9987e969199e8e7d21b07fc865b0ff864d4e9c7bcbf2323493c5bc74de8","observation_id":"c8b26145-bd85-472d-ac7c-7dd1757adcc6","resolution":{"observed_at":"2026-07-02T08:46:48.915321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2607.01223","last_updated":"2026-07-01T17:56:42Z","snapshot_observed_at":"2026-08-08T04:08:04.138017Z","submitted_at":"2026-07-01T17:56:42Z","title":"Theoria: Rewrite-Acceptability Verification over Informal Reasoning States","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T12:12:20.879377Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2607.01223"},"observation_digest":"sha256:35e49ceb3612f36147c09825dd38707e53f0540b8bc96c119d6936cc9aca859c","observation_id":"fc6e7769-7fc5-47cd-a782-be6c4bdcb884","resolution":{"observed_at":"2026-07-02T12:16:56.432836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":"2406.03816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-09T03:45:55.622776Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":"cs.CL","work_id":"9d2d6c17-1634-436a-a540-276ac2f258df","year":2024},"citing_paper":{"arxiv_id":"2607.07663","last_updated":"2026-07-08T17:19:50Z","snapshot_observed_at":"2026-07-30T01:44:04.256851Z","submitted_at":"2026-07-08T17:19:50Z","title":"Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-09T03:36:57.168246Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2607.07663"},"observation_digest":"sha256:5fdc39d366501f706dc964fa582c8a119efaf780882d1fe446376af7f4c81824","observation_id":"d5ea40c1-a14f-41a6-8463-a32c16913dd9","resolution":{"observed_at":"2026-07-09T03:45:55.624038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2406.03816 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-07T19:26:40.944900Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:35f8e4594412845d4327c71294846f5835e1843923722a7c669545cd1aa94b47","observation_id":"98df491d-4780-4f9e-9cc5-a0fea5e01a3a","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-02T09:54:59.726132Z","title":"Zhang, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16244","last_updated":"2026-06-26T11:50:29Z","snapshot_observed_at":"2026-08-02T19:37:47.838699Z","submitted_at":"2026-06-26T11:50:29Z","title":"CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:54:59.726132Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2607.16244"},"observation_digest":"sha256:e34d32fb1dbd29df0a73ab50d083cafb95216a4ac0198506bc0fb179f23d5933","observation_id":"02923fb9-c267-4ac0-a44d-b3571225cc57","resolution":{"observed_at":"2026-08-02T09:54:59.726132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-01T06:32:24.768710Z","title":"ReST-MCTS*: LLM self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21856","last_updated":"2026-07-23T22:50:23Z","snapshot_observed_at":"2026-08-07T15:15:19.846490Z","submitted_at":"2026-07-23T22:50:23Z","title":"LeAct: Learning to Reason from Expert Actions","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:24.768710Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2607.21856"},"observation_digest":"sha256:34f9f6a8989fbf746b77a0bd309939cd7e2d2810c5818ca9fd147ce575108ba7","observation_id":"76aac002-9dd0-447e-aa6e-1327ef9e72ab","resolution":{"observed_at":"2026-08-01T06:32:24.768710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.03816/citation-record","integrity":"/paper/2406.03816/integrity","json":"/paper/2406.03816/citation-record.json","paper":"/paper/2406.03816"},"outbound":[],"paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2406.03816."}