{"as_of":"2026-08-14T11:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b53643fcb33a1074832440651d94c9c11d6b80026af270c01484361fba2ea715","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:45:25.874749Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:56.891313Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.670108Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"cited_work":{"arxiv_id":"2508.19576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19576","snapshot_observed_at":"2026-07-03T14:08:21.670108Z","title":"Rest-rl: Achieving accurate code reasoning of llms with optimized self-training and decoding,","venue":null,"work_id":"2fca031a-ed7e-4c85-b8a3-c67142557927","year":2025},"citing_paper":{"arxiv_id":"2604.14564","last_updated":"2026-04-16T02:52:24Z","snapshot_observed_at":"2026-08-11T13:39:47.480025Z","submitted_at":"2026-04-16T02:52:24Z","title":"MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T11:27:28.245835Z"},"links":{"cited_paper":"/paper/2508.19576","citing_paper":"/paper/2604.14564"},"observation_digest":"sha256:a1cb2b6fb6dcc8f975758fdf286d1511d4696e527c86847d95e9226d818a6edd","observation_id":"faac2c7a-0710-4a7d-ae45-b324f3875e95","resolution":{"observed_at":"2026-05-10T11:30:18.824443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"cited_work":{"arxiv_id":"2508.19576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19576","snapshot_observed_at":"2026-07-03T14:08:21.670108Z","title":"Rest-rl: Achieving accurate code reasoning of llms with optimized self-training and decoding,","venue":null,"work_id":"2fca031a-ed7e-4c85-b8a3-c67142557927","year":2025},"citing_paper":{"arxiv_id":"2606.13176","last_updated":"2026-06-11T10:44:50Z","snapshot_observed_at":"2026-08-12T17:43:46.479966Z","submitted_at":"2026-06-11T10:44:50Z","title":"Mental-R1: Aligning LLM Reasoning for Mental Health Assessment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T07:15:00.398111Z"},"links":{"cited_paper":"/paper/2508.19576","citing_paper":"/paper/2606.13176"},"observation_digest":"sha256:8c4f1788fdaf4620eec53390254763318489416f8090f3a85941ab5f52850bf8","observation_id":"ecddc6aa-ea6c-481f-914b-ec867be66e78","resolution":{"observed_at":"2026-07-03T14:08:21.671873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19576","snapshot_observed_at":"2026-08-07T12:23:56.891313Z","title":"ReST-RL: Achieving accurate code reasoning of LLMs with optimized self-training and decoding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06216","last_updated":"2026-08-12T04:11:22Z","snapshot_observed_at":"2026-08-14T11:15:21.273940Z","submitted_at":"2026-08-06T16:07:26Z","title":"Continual Learning in Transition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:56.891313Z"},"links":{"cited_paper":"/paper/2508.19576","citing_paper":"/paper/2608.06216"},"observation_digest":"sha256:c0d7672fad73c8826654e4671fb9cdf71f062426ad176555e0b9a114fde55396","observation_id":"d6f58a78-07b7-4087-9e46-9547b07c6fd2","resolution":{"observed_at":"2026-08-07T12:23:56.891313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19576/citation-record","integrity":"/paper/2508.19576/integrity","json":"/paper/2508.19576/citation-record.json","paper":"/paper/2508.19576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.345030Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.345030Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:65d9940dbed40c7003d945f2d7b61fd30b87edd1a02e1e24c6026db37a8fdbfc","observation_id":"a60a4c92-264c-447b-8b38-be13e1b5183b","resolution":{"observed_at":"2026-08-05T15:45:24.345030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.394829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.394829Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:879156ac00e00eee3e208e5ce27a3face481135cf855a87d70715d51082b6e60","observation_id":"bd05cd66-c6bb-414c-a6d5-e445557a6857","resolution":{"observed_at":"2026-08-05T15:45:24.394829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:30.385760Z","title":"The lessons of developing process reward models in mathematical reasoning, 2025","venue":null,"work_id":"3d63ede1-24c1-4c1b-bf80-3a0098f57fa5","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.445026Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:747be25bb6ccc7376d5bf6b590939600298a856c72e6b2349c147a9e51565c02","observation_id":"0464326c-2220-4f6c-909e-d1c51896f0ff","resolution":{"observed_at":"2026-08-05T15:45:30.424911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.466089Z","title":"Measuring coding challenge competence with apps, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.466089Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:d4c512c16a404cf32d92c138b284e9a6e653d002f4f84ff810ec2919a63465ee","observation_id":"285765fa-6c82-49c7-89c2-f592990cd7fd","resolution":{"observed_at":"2026-08-05T15:45:24.466089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:30.154826Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions, 2025","venue":null,"work_id":"b0c9cf10-51b9-4378-8ecd-55922d600bbf","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.507007Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:246c7066b87755eb4f77d6f679367d8e1fe76b261aab85a426833813c851828c","observation_id":"b14037e4-5565-4d98-8b12-1f5a4cf810d1","resolution":{"observed_at":"2026-08-05T15:45:30.176357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.557391Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.557391Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:b30cc65925e21f4a8adc396bc7c0108e07a5dacd8e54b37ab4492699f81bd516","observation_id":"6de4234e-f4a4-43c3-99af-0c1adfb6f309","resolution":{"observed_at":"2026-08-05T15:45:24.557391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.606921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.606921Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:2ea606227f45cd9c1b685736cf32e39d33ebb8f23a3e6aeb546619e068a3f00d","observation_id":"ab22b356-6564-4fd2-9f72-eacc65650263","resolution":{"observed_at":"2026-08-05T15:45:24.606921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:29.814837Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":"9ee219a2-7f4d-4094-a418-e14247823e6c","year":2017},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.634749Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:bcf676fb92d9a7fbee6080f34f649ce94aac5d86130b0f80b2b2a0812ed85709","observation_id":"92664116-49b8-468f-9888-29660062a672","resolution":{"observed_at":"2026-08-05T15:45:29.850809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.665314Z","title":"Reinforced self-training (rest) for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.665314Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:024df38af21b0b1ad6c6b55436b7cb0b05ac4b7b0dee58aca640904155c14dc5","observation_id":"b633ee1d-19fb-4e55-bc88-399855cef95b","resolution":{"observed_at":"2026-08-05T15:45:24.665314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.691732Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.691732Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:0142497c48b5bd7d0857edb587bd9346a078006a36f787be814f3b4f092d3941","observation_id":"8b07e88e-f82b-4015-879d-84ab74b7dec5","resolution":{"observed_at":"2026-08-05T15:45:24.691732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.715154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.715154Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:c20050a0ec891e0cb0057dfd7bade3780faa6f9def4c2d0038ccce658d04ad04","observation_id":"7ac86a5a-13e6-422a-a657-8efefc8693bb","resolution":{"observed_at":"2026-08-05T15:45:24.715154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-13T05:04:53.813940Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T15:45:24.746306Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.746306Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:579cd5300925c43edfb536ce528665aebbd4c6270d640fd51c38beceafd921ab","observation_id":"87b836da-7df4-457d-a007-3dbb733fc341","resolution":{"observed_at":"2026-08-05T15:45:24.746306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.772773Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.772773Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:48579899a845fc5fea8f619ee1a1cdf38c8259efd5ec54e64f4e5088acb4b038","observation_id":"395e6487-9a00-42b5-816e-1352a9c5a287","resolution":{"observed_at":"2026-08-05T15:45:24.772773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.807225Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.807225Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:903dcc79d338a4e658955715e99102777a511aec6f2ccdd16e04e96ca72af572","observation_id":"26a75e80-eec5-40d5-bc22-5b826471279b","resolution":{"observed_at":"2026-08-05T15:45:24.807225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.854247Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.854247Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:70c998315c41eade08debd099ea70863d1adf598a8085790b67796f3442ef560","observation_id":"cf8b6baa-1348-419d-a785-65e77a65bd9a","resolution":{"observed_at":"2026-08-05T15:45:24.854247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:29.084743Z","title":"Don’t throw away your value model! generating more preferable text with value-guided monte-carlo tree search decoding, 2024","venue":null,"work_id":"3baf9ef5-4e00-458c-8233-6e164d20ad3f","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.894475Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:86795a312387e8ed918109e1f866cfca75a3eab59e2e2471801f9994661b10b7","observation_id":"b2298171-678a-429f-b3ab-d93bede8b177","resolution":{"observed_at":"2026-08-05T15:45:29.124983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.908108Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.908108Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:da7aeef48a74a0f9218aeaf0d086bbc974297b52240dd2ad8d742cd03e34f34b","observation_id":"7d9bf68a-649b-4cf0-9b89-28b967dd121c","resolution":{"observed_at":"2026-08-05T15:45:24.908108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.844747Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization, 2025","venue":null,"work_id":"6b6ad7b7-637e-4e91-8878-5a5fcdaa8215","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.935044Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:4b6976124357143a4628c97a9d07e6914f3db20c804a109fe003aa8b624bb1cd","observation_id":"d026e5d3-7815-40cd-b6c9-57440a7e51fd","resolution":{"observed_at":"2026-08-05T15:45:28.884827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.974749Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.974749Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:1c6a0d4c7dd0db22559ea96b64e912a803644e89fdf98565d4148daef1db78ac","observation_id":"67be6a1d-670a-4911-b0be-c06630bba609","resolution":{"observed_at":"2026-08-05T15:45:24.974749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.584746Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":"9d67e8b5-a322-416d-a03a-58b81c4f4a2d","year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.024763Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:c6532a2576e957b8a3f9ad7340bb8c63af12a36580d060a07cd22e0d0bf84de9","observation_id":"4483e15b-d22a-450a-ae42-64843050f91f","resolution":{"observed_at":"2026-08-05T15:45:28.654742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.454829Z","title":"Code with codeqwen1.5, April 2024","venue":null,"work_id":"1d921812-b250-4dbc-9dff-9dcddf96b7fc","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.057163Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:95cf529b854955e5528229681111724c991e639768984784f3bcac64cd58975b","observation_id":"7426c0c7-f201-4fe8-9947-e31e6a755f36","resolution":{"observed_at":"2026-08-05T15:45:28.494850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14658","last_updated":"2025-01-07T05:37:04Z","snapshot_observed_at":"2026-08-13T04:12:47.707151Z","submitted_at":"2024-02-22T16:06:23Z","title":"OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14658","snapshot_observed_at":"2026-08-05T15:45:25.104749Z","title":"Opencodeinterpreter: Integrating code generation with execution and refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.104749Z"},"links":{"cited_paper":"/paper/2402.14658","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:1fc57a5172201a9faea6838f5334aff3283b8555afe60dc8675c2427f076182a","observation_id":"e00ea81a-0836-4ae5-9e35-a39b47ab048e","resolution":{"observed_at":"2026-08-05T15:45:25.104749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.324745Z","title":"Tenenbaum, and Chuang Gan","venue":null,"work_id":"0bbeabc2-6a3d-44d4-8558-37fe39881a94","year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.145037Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:81e773243be4e3b500ad304e7428896ef30fe6e066fb758ff286fdfaa83e68dd","observation_id":"ced27b90-3a83-484a-a60f-dcb6b9027441","resolution":{"observed_at":"2026-08-05T15:45:28.355103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.174975Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":"e13b8557-a96d-4c05-a87e-156527ff3c9b","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.195191Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:7caeab8bca3fc8e5dcf0f46fd267f2331eb692954c1d4179ab1496a283a1cc7c","observation_id":"92ee3d93-802c-4791-8843-9a1f350c15cd","resolution":{"observed_at":"2026-08-05T15:45:28.224747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.245194Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.245194Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:8fa782d589a989669ae0a68e733118436215abf999b9b9b90c2d0f5c45bc07a7","observation_id":"db52f004-bdc6-46db-98bf-c841ce605ba3","resolution":{"observed_at":"2026-08-05T15:45:25.245194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:27.912378Z","title":"Pspo*: An effective process-supervised policy optimization for reasoning alignment, 2024","venue":null,"work_id":"de0b70ed-4347-4aa3-bda5-4f9c0875ab65","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.284748Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:6aba7be586748eef5cb3474e5aa69aa98a23d64d34b40d5ddd1ce7200ac9986a","observation_id":"efde76ed-bddc-498b-bb3a-9ca6434be0e5","resolution":{"observed_at":"2026-08-05T15:45:27.986574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:27.434826Z","title":null,"venue":null,"work_id":"fa8913bd-0977-4a1e-80f4-b56ed77a57f1","year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.334751Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:8c2e0420503586ddd7154c33cd4f9a0f90a32297082edee6195aa250caa79874","observation_id":"4dff5136-fc75-4f6a-8de6-66ce1bea5707","resolution":{"observed_at":"2026-08-05T15:45:27.674899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.384748Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.384748Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:73bd8fb95298ccb4a31392ad2e1e998d95ef26480e921eedcf7e7b48588624bc","observation_id":"633b31e6-0ab6-414b-aa06-415a3df86dc0","resolution":{"observed_at":"2026-08-05T15:45:25.384748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.434824Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.434824Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:98cfdcda5ca3f52195c1c52b2eaab3f73db421d7a8a20e44fb01da81ca726b99","observation_id":"3afc0a37-acd2-4b08-8782-f6ee69c42127","resolution":{"observed_at":"2026-08-05T15:45:25.434824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:26.884088Z","title":"Sra-mcts: Self-driven reasoning augmentation with monte carlo tree search for code generation, 2025","venue":null,"work_id":"24d9384e-831f-480c-9c8b-531d88d204d1","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.475053Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:5177e09ee1d590b3dc0f814cc9eee3ef6dee497c8f5f9957bad5552a01a10063","observation_id":"b9d8e6d4-9b13-4c45-a38e-0ce90ee69bf4","resolution":{"observed_at":"2026-08-05T15:45:27.054841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.524747Z","title":"Accessing gpt-4 level mathematical olympiad solutions via monte carlo tree self-refine with llama-3 8b, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.524747Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:8686ddbab0f67facb62fc06dcb3f5510a15f48a29030fcc36e8a3dffa5de6902","observation_id":"f14061ea-d91f-4861-b37e-73c7d3245ce1","resolution":{"observed_at":"2026-08-05T15:45:25.524747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.574819Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.574819Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:073411815256c98c4f41444649db1b43cf011ff732d73ccb72fdf9aca8aa9592","observation_id":"283cc7ff-73ce-46b9-a5c6-f315b223cce8","resolution":{"observed_at":"2026-08-05T15:45:25.574819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-05T15:45:25.624748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.624748Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:9b381f955d4fdfaa88187b89536df70fc673c7c776df1798351dc413f640231a","observation_id":"3c654c56-76c3-4b7a-9920-237fa938e6ff","resolution":{"observed_at":"2026-08-05T15:45:25.624748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.674750Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.674750Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:4d1ecd5e1aa4e47d42bd8f88e562d6a2cbed409da36292247e6084a78e8de89c","observation_id":"629afcb8-3aff-44ef-b900-cd5457763673","resolution":{"observed_at":"2026-08-05T15:45:25.674750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.717705Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.717705Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:6f05ecfdf1cd989a7d184fba73cb079e7065a5154abfd115710b7dad2b224392","observation_id":"d069aee4-119a-4538-a5cb-537ee583cb65","resolution":{"observed_at":"2026-08-05T15:45:25.717705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.764827Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.764827Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:691a172a2f8b65f0d331bf3e84e9f5b9d39b795ba770be114e5c7edbeb654dbf","observation_id":"87a5e739-ada5-49ec-b3d4-c7812f70237e","resolution":{"observed_at":"2026-08-05T15:45:25.764827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.814825Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.814825Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:5c4e793a39b544f3b671bc3b0b54c891f82fc54a36d31942c53fd5f909c5d846","observation_id":"0b083143-5493-4f29-95ae-d9af24999b87","resolution":{"observed_at":"2026-08-05T15:45:25.814825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.854752Z","title":"Reward hacking in reinforcement learning.lilianweng.github.io, Nov 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.854752Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:4e95faae9b6d89eb06a050921a9831c3b6688c5c0932083bc1d64dbddf3a48ae","observation_id":"c177dc3c-5724-40b6-80a9-cea292e5f0cb","resolution":{"observed_at":"2026-08-05T15:45:25.854752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-05T15:45:25.874749Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.874749Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:3bd1d36130ef1fd78db08340f3fbd89ac2221e935f88097185e723aa0ed35437","observation_id":"c5d66e67-fb19-425b-a5e7-c3f3d9d21913","resolution":{"observed_at":"2026-08-05T15:45:25.874749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T04:59:39.981966Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2508.19576."}