{"as_of":"2026-08-11T15:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c4fea126359a011f7b18b8d8a66bb916311aa7006b2468f070d67fc3423835b","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:40:13.929186Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:58:08.171009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T10:58:14.255418Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-08-11T11:58:08.171009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15305","last_updated":"2025-08-04T08:15:22Z","snapshot_observed_at":"2026-08-11T11:52:43.600760Z","submitted_at":"2024-12-19T12:31:22Z","title":"Tree-of-Code: A Tree-Structured Exploring Framework for End-to-End Code Generation and Execution in Complex Task Handling","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T11:58:08.171009Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2412.15305"},"observation_digest":"sha256:4c3098ecd0d35742d6f636b24291b485622a0c1e1cf3be653a7fc92c48de55e8","observation_id":"09d531f7-c4fd-4a71-8e9c-f5a60d88606c","resolution":{"observed_at":"2026-08-11T11:58:08.171009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":"2412.15118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning through execution: Unifying process and outcome rewards for code generation","venue":null,"work_id":"0a52077f-89ee-4f03-8263-fff7b923840e","year":2024},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:6c05ca3d728b3f8f18df54fe09cf26a5d8ce2f3522b29ad84bf84fd020e53049","observation_id":"203cd53b-02d3-43fe-a313-1771f3ae7f2b","resolution":{"observed_at":"2026-05-13T01:36:24.180661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-08-07T11:04:06.882676Z","title":"Outcome-refining process supervision for code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.882676Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:a5e6fffdafa823a186618308367d5dbfa76ee2382246e60c7522037d7c1bc4fc","observation_id":"d1464911-8e0c-4a5c-9e45-9069c5ea5cba","resolution":{"observed_at":"2026-08-07T11:04:06.882676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-08-06T20:39:15.005796Z","title":"Outcome-refining process supervision for code generation.arXiv preprint arXiv:2412.15118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02256","last_updated":"2025-07-03T03:09:17Z","snapshot_observed_at":"2026-08-10T23:16:24.673458Z","submitted_at":"2025-07-03T03:09:17Z","title":"Uncertainty-aware Reward Design Process","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:15.005796Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2507.02256"},"observation_digest":"sha256:ffc367bad6c7e95999e83b6f0f87cb2639b88c6291fe920c6a9a732a6b12cbbb","observation_id":"52545019-4836-4976-b621-651dc3176642","resolution":{"observed_at":"2026-08-06T20:39:15.005796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-08-05T22:09:46.486332Z","title":"Outcome-refining process supervision for code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07434","last_updated":"2025-08-10T17:11:56Z","snapshot_observed_at":"2026-08-07T02:35:17.826871Z","submitted_at":"2025-08-10T17:11:56Z","title":"Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T22:09:46.486332Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2508.07434"},"observation_digest":"sha256:d95d6fa615e35748ecc8b85f44d9d18c4a7b33e25a21948ac5e86099d34cd20d","observation_id":"17a017c2-4a37-4946-8c7f-74c9554f0182","resolution":{"observed_at":"2026-08-05T22:09:46.486332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":"2412.15118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning through execution: Unifying process and outcome rewards for code generation","venue":null,"work_id":"0a52077f-89ee-4f03-8263-fff7b923840e","year":2024},"citing_paper":{"arxiv_id":"2605.07248","last_updated":"2026-05-08T05:09:18Z","snapshot_observed_at":"2026-08-11T00:31:05.125412Z","submitted_at":"2026-05-08T05:09:18Z","title":"PaT: Planning-after-Trial for Efficient Test-Time Code Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-11T02:39:41.247353Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2605.07248"},"observation_digest":"sha256:a199efbdf0d6d820fd4a1bc221f72ab3c210a90b42f9cc9ab5a8a3bc38fd75ff","observation_id":"17a3fe2c-b1a3-4d2b-b814-9c5777247b80","resolution":{"observed_at":"2026-05-11T02:45:59.120557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":"2412.15118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning through execution: Unifying process and outcome rewards for code generation","venue":null,"work_id":"0a52077f-89ee-4f03-8263-fff7b923840e","year":2024},"citing_paper":{"arxiv_id":"2605.08468","last_updated":"2026-05-08T20:39:32Z","snapshot_observed_at":"2026-08-02T16:12:56.247576Z","submitted_at":"2026-05-08T20:39:32Z","title":"PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:12:37.970638Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2605.08468"},"observation_digest":"sha256:aef8cf630feed946d3c4cb99d3a97ffbd9c4de024cdfd94fd94daff4b9ff221b","observation_id":"34ea2427-17f8-4f5d-beef-f730b276871f","resolution":{"observed_at":"2026-05-12T08:21:26.085532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"cited_work":{"arxiv_id":"2412.15118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15118","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning through execution: Unifying process and outcome rewards for code generation","venue":null,"work_id":"0a52077f-89ee-4f03-8263-fff7b923840e","year":2024},"citing_paper":{"arxiv_id":"2605.18747","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:59:03Z","title":"Code as Agent Harness","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-20T10:54:54.558241Z"},"links":{"cited_paper":"/paper/2412.15118","citing_paper":"/paper/2605.18747"},"observation_digest":"sha256:98135305778ff203cef1d3b77c61fc0d7e2ba94604a7b78aabff0c7f8cc6d965","observation_id":"76e3a7e2-e4c0-4404-9ab0-152fada9cb12","resolution":{"observed_at":"2026-05-20T10:58:14.257707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15118/citation-record","integrity":"/paper/2412.15118/integrity","json":"/paper/2412.15118/citation-record.json","paper":"/paper/2412.15118"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-11T11:40:13.325887Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.325887Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:7a8d716200d1020167df9855766ebcb344251da2c02c7021410e107c5b5706cc","observation_id":"eb779ac7-74da-4e6f-ba6f-793873d6cf64","resolution":{"observed_at":"2026-08-11T11:40:13.325887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.332953Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.332953Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:652682b3ffe223620c6a90488a0a065154315f3837e311892ab0d09b5ea70521","observation_id":"48e54348-a47b-4dd6-b543-c17e2b472023","resolution":{"observed_at":"2026-08-11T11:40:13.332953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-11T11:40:13.339021Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.339021Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:4dda4912021ba365b00dcc4630b52f142c4b7f7d55949007f81de601027121a9","observation_id":"8ca6ce34-d9ce-4782-9db0-0def01dba5c0","resolution":{"observed_at":"2026-08-11T11:40:13.339021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04023","last_updated":"2023-11-28T09:01:12Z","snapshot_observed_at":"2026-08-07T14:17:12.140094Z","submitted_at":"2023-02-08T12:35:34Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04023","snapshot_observed_at":"2026-08-11T11:40:13.345001Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.345001Z"},"links":{"cited_paper":"/paper/2302.04023","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:0bbba9ed21b89bf44e20fd07c1dc2700c182de4144df1f1827c912d97fc4965a","observation_id":"69a8cb3e-c54f-4e2a-95da-a94db4765208","resolution":{"observed_at":"2026-08-11T11:40:13.345001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.351108Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.351108Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:c0da030593c45024a46e89ae6512570c73c6689610f4a1a4584257e5c33eef93","observation_id":"e0f71f89-34a9-421b-a6c3-dc25e02a9eac","resolution":{"observed_at":"2026-08-11T11:40:13.351108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.358630Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.358630Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:2e64e3340afd0db6c590022d12b60a176583640e9426c9365cabe79a9e036d20","observation_id":"d1bf37d6-071c-436c-9cd4-1285d0d56444","resolution":{"observed_at":"2026-08-11T11:40:13.358630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03109","last_updated":"2023-12-29T02:12:03Z","snapshot_observed_at":"2026-08-05T13:54:21.157165Z","submitted_at":"2023-07-06T16:28:35Z","title":"A Survey on Evaluation of Large Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03109","snapshot_observed_at":"2026-08-11T11:40:13.366864Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.366864Z"},"links":{"cited_paper":"/paper/2307.03109","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:b9ec8f19483c407f269b4fb64cca384a4b8cc0ba98af2766db289b0beb578b19","observation_id":"d21cccbd-1ebc-455f-812b-a82aefaae2b9","resolution":{"observed_at":"2026-08-11T11:40:13.366864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.373671Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.373671Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:8b72adf3126863e420885481e8e8eb6572463ad83c50ab19c046448743b99063","observation_id":"571876d5-c29b-4d38-b337-aaa84bc4bb75","resolution":{"observed_at":"2026-08-11T11:40:13.373671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10669","last_updated":"2024-09-26T03:16:52Z","snapshot_observed_at":"2026-07-06T17:31:08.762955Z","submitted_at":"2024-02-16T13:21:06Z","title":"Humans or LLMs as the Judge? A Study on Judgement Biases","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10669","snapshot_observed_at":"2026-08-11T11:40:13.379357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.379357Z"},"links":{"cited_paper":"/paper/2402.10669","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:d6b96bb39fa06d7fb459dd18ff834ed95a232653a272c217a2211e0a77d465eb","observation_id":"02db9a5c-1e71-4426-b6cc-829e4d8d7069","resolution":{"observed_at":"2026-08-11T11:40:13.379357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-08T14:49:36.757543Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-11T11:40:13.386373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.386373Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:04d272b0b2f6c3792f08e036e35ea95fcdaffb569288b217302add494ec3328f","observation_id":"e0bd076b-a5d7-41c5-8003-40cd93367b9f","resolution":{"observed_at":"2026-08-11T11:40:13.386373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T11:40:13.393373Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.393373Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:cfac820a76f6d112300e362fb38d901a1b3ed4df397c5a4d76ed1fdcceb6dd64","observation_id":"ee278aef-ea54-4115-a3b8-40d88eb7e7aa","resolution":{"observed_at":"2026-08-11T11:40:13.393373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05128","snapshot_observed_at":"2026-08-11T11:40:13.399800Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.399800Z"},"links":{"cited_paper":"/paper/2304.05128","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:cd770ccd6c3a6bd7f9a6908f46c49214367c5eaefc4e611b6e9ce7d3fec4f29c","observation_id":"2487c80a-ee0d-45dd-8e23-1d60f9fa489a","resolution":{"observed_at":"2026-08-11T11:40:13.399800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11452","last_updated":"2024-02-18T04:28:16Z","snapshot_observed_at":"2026-08-09T03:53:20.982347Z","submitted_at":"2024-02-18T04:28:16Z","title":"AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11452","snapshot_observed_at":"2026-08-11T11:40:13.416304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.416304Z"},"links":{"cited_paper":"/paper/2402.11452","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:1a72e67a733185babe6dc598de834b352800c668f4afe306db0e41f7e96155e0","observation_id":"d68ad560-f7e8-49d3-ae7b-c9fb509d22fa","resolution":{"observed_at":"2026-08-11T11:40:13.416304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.423677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.423677Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:9238ba4c8aa461cfbfdf656059794be3cbb16f3fc4be03a1111e14491f106030","observation_id":"3cf58c6e-759e-4c37-a097-3906855e84d5","resolution":{"observed_at":"2026-08-11T11:40:13.423677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T11:40:13.430152Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.430152Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:4ee6eccdad4aaeb01d265bd9d90b726442cf98ca08471b551f0b737d844d813a","observation_id":"5ed50337-2d4b-475a-9901-97547d61ed10","resolution":{"observed_at":"2026-08-11T11:40:13.430152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T11:40:13.437950Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.437950Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:159f07dcee8af7447f2486e82360f41c367ec00809dcd166edc9a8185ff2a37c","observation_id":"bf3b52c8-b1a3-40a6-8583-02113d899665","resolution":{"observed_at":"2026-08-11T11:40:13.437950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17621","last_updated":"2025-02-04T09:24:30Z","snapshot_observed_at":"2026-08-09T22:29:40.333315Z","submitted_at":"2024-10-23T07:22:33Z","title":"Process Supervision-Guided Policy Optimization for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17621","snapshot_observed_at":"2026-08-11T11:40:13.444151Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.444151Z"},"links":{"cited_paper":"/paper/2410.17621","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:4c1eefd25bebcbcaaea74f5e02355189f6b1c8011dc910b708f0bf8045274dc9","observation_id":"2c0c0f92-8edd-4256-b486-10a6cba74533","resolution":{"observed_at":"2026-08-11T11:40:13.444151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-07T15:45:43.952318Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-11T11:40:13.450996Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.450996Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:b0c91c403f2c526134b843fec8559c47f47314387afd121578c57558061708d9","observation_id":"718b1a2a-829f-435d-a7e9-84b6e969e050","resolution":{"observed_at":"2026-08-11T11:40:13.450996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:40:13.457474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.457474Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:e7b17db9fb982bf0e7acd2af1fa525a56576c04431c1516891f2c935b4ee2210","observation_id":"0cf9d67b-cf4d-494d-91c1-8369b2545292","resolution":{"observed_at":"2026-08-11T11:40:13.457474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.463287Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.463287Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:2b468b9352261b02fdcd2ca3cd94461f7d98b1acc614dc20272ff3db493b157a","observation_id":"5e511dbc-dea7-4cdc-964e-757d30254870","resolution":{"observed_at":"2026-08-11T11:40:13.463287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01806","last_updated":"2017-06-14T01:00:18Z","snapshot_observed_at":"2026-07-06T05:29:01.228177Z","submitted_at":"2017-02-06T22:08:46Z","title":"Beam Search Strategies for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01806","snapshot_observed_at":"2026-08-11T11:40:13.470380Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.470380Z"},"links":{"cited_paper":"/paper/1702.01806","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:5f25283247ca77f6300c0adf18b610c4181c0b6542a29e05a63210a24a11ca95","observation_id":"fbcea886-138e-4f7c-9c3f-fe928f0535ab","resolution":{"observed_at":"2026-08-11T11:40:13.470380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-11T11:40:13.478494Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.478494Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:f2fa80bb31ae3c63e31e317549dfd16a10e0c588c3f48247138d53cd70b628ff","observation_id":"71639010-3403-4d9b-858d-4dcfa59b9da2","resolution":{"observed_at":"2026-08-11T11:40:13.478494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.484405Z","title":"Dahl, Justin Gilmer, Christopher J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.484405Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:cda1da9b24c60d0d69b44b7d14e3c417a11b6c79e6cd89c7a96fba7639962a55","observation_id":"d1c768ad-a2bd-421b-922f-c8c4cbc16db1","resolution":{"observed_at":"2026-08-11T11:40:13.484405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.490294Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.490294Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:aad251671c325c4fd54f070d2047aa3c616a04861f93cf540857e5c2b9ece313","observation_id":"224bbb40-72d6-4796-be00-2d3fc1946578","resolution":{"observed_at":"2026-08-11T11:40:13.490294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-11T11:40:13.496947Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.496947Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:9ca5d8367cec1b461fa5fa324fcae7e6917321efb7a3db4559634a751ed10676","observation_id":"26325a09-e1b4-4535-b8c7-5a4e6080b258","resolution":{"observed_at":"2026-08-11T11:40:13.496947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-11T11:40:13.503690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.503690Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:5c1abd04da962e6b57c1bb573e0a34de928355069fdb6f282f5dcb6aabcdedfc","observation_id":"413735c4-33a4-40d9-ad29-91cf9ef000c2","resolution":{"observed_at":"2026-08-11T11:40:13.503690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00390","last_updated":"2024-06-29T10:09:49Z","snapshot_observed_at":"2026-07-06T18:38:54.776114Z","submitted_at":"2024-06-29T10:09:49Z","title":"Advancing Process Verification for Large Language Models via Tree-Based Preference Learning","version":1},"cited_work":{"arxiv_id":"2407.00390","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.00390","snapshot_observed_at":"2026-08-11T11:40:14.989063Z","title":"Advancing Process Verification for Large Language Models via Tree-Based Preference Learning","venue":"cs.CL","work_id":"5a5424b8-e970-4e62-bd65-95b8cf07f0e8","year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.509509Z"},"links":{"cited_paper":"/paper/2407.00390","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:294f58f91e9036f06b0cf10598e540d6e1bb7a82ed5028051849048bb62088b5","observation_id":"3b1dc32b-1cc9-4a0f-89e9-510e79ceaaaa","resolution":{"observed_at":"2026-08-11T11:40:14.995566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06903","last_updated":"2024-09-10T22:57:58Z","snapshot_observed_at":"2026-07-06T19:13:28.897964Z","submitted_at":"2024-09-10T22:57:58Z","title":"Semi-Supervised Reward Modeling via Iterative Self-Training","version":1},"cited_work":{"arxiv_id":"2409.06903","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.06903","snapshot_observed_at":"2026-08-11T11:40:14.961925Z","title":"Semi-Supervised Reward Modeling via Iterative Self-Training","venue":"cs.LG","work_id":"7d18cbcb-6f91-4ef7-b496-06785e5a07f1","year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.515676Z"},"links":{"cited_paper":"/paper/2409.06903","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:419757f3330deed8b432a5264ce48c9acd4b9ea4f12f2d83f60e1adb55e148d1","observation_id":"f364168f-877b-4dee-9cbf-a984324bcd3a","resolution":{"observed_at":"2026-08-11T11:40:14.969016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-11T11:40:13.522298Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.522298Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:176a2938cef5fa932bb9a7fb2728747d38e739e12649608a362e7e54a3371842","observation_id":"77366387-8d5f-4235-8154-b4b76b697fa8","resolution":{"observed_at":"2026-08-11T11:40:13.522298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.528702Z","title":"Hinton, Simon Osindero, and Yee Whye Teh","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.528702Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:8ad7c35da52e920c3c972de052ff61320f6e6fb7c33f06d814a0ff39ba3ad095","observation_id":"906d42df-e222-4e89-bba2-b79fd01457ed","resolution":{"observed_at":"2026-08-11T11:40:13.528702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.535113Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.535113Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:685ff97f0bd04e3ac1927909ca9bd02194439162bd00b9947854abc155328641","observation_id":"4613e2ad-60d2-4bc3-bcc1-039481cc42c9","resolution":{"observed_at":"2026-08-11T11:40:13.535113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.541064Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.541064Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:361f309cb494fc974aff39c85add56ecd5f78df2f90aad2df4ca7d8c2d32794b","observation_id":"62ffa837-8c38-43c9-b7f3-bfbaf2c2ce2f","resolution":{"observed_at":"2026-08-11T11:40:13.541064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12055","last_updated":"2024-06-28T14:53:35Z","snapshot_observed_at":"2026-08-11T03:41:09.103830Z","submitted_at":"2024-02-19T11:19:02Z","title":"Are LLM-based Evaluators Confusing NLG Quality Criteria?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12055","snapshot_observed_at":"2026-08-11T11:40:13.547528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.547528Z"},"links":{"cited_paper":"/paper/2402.12055","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:fd6fe0c959cd3a62aab41004f0d505be1ddf710f8b49235a14daa904d221f255","observation_id":"d4ca5e5d-aad4-4125-adf2-1382a9ae72fc","resolution":{"observed_at":"2026-08-11T11:40:13.547528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-11T11:40:13.553093Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.553093Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:6549ed16a711f1dcbf577267f97649c72fc7fc1d925545a0c9c606c746399087","observation_id":"d5f4e840-29ec-4bb9-8cc5-6c59f15ee07a","resolution":{"observed_at":"2026-08-11T11:40:13.553093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-11T11:40:13.559229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.559229Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:02e815bec20043c836b9747eaec4958de121b8c9f0f5399651bc37141f6075b7","observation_id":"6c8edc09-6616-4806-9ef9-c0e2b5273061","resolution":{"observed_at":"2026-08-11T11:40:13.559229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T11:40:13.566559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.566559Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:094bd598742353a2b605db4cecbe8e6fdbf63023de1e11b5dd75a93aa530d9c8","observation_id":"bea1843f-9860-4e6e-bbea-7067cbe75c6c","resolution":{"observed_at":"2026-08-11T11:40:13.566559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-11T11:40:13.573242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.573242Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:9cb0b3c60ada176e32493c4ef5058882117bbf0bab263db4b7a681ac3915a8d8","observation_id":"013e91a3-d384-4d50-8392-cad253850189","resolution":{"observed_at":"2026-08-11T11:40:13.573242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T11:40:13.579447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.579447Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:ce6c49dc9908c51ceb1e7d64d2014eb369924a5234ae31e474974ea7d6f0ad60","observation_id":"1c8c8569-b99d-4c4a-8b5e-8f17464f976d","resolution":{"observed_at":"2026-08-11T11:40:13.579447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11694","last_updated":"2024-12-31T01:38:12Z","snapshot_observed_at":"2026-08-09T03:55:09.041328Z","submitted_at":"2024-11-18T16:15:17Z","title":"Enhancing LLM Reasoning with Reward-guided Tree Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11694","snapshot_observed_at":"2026-08-11T11:40:13.585941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.585941Z"},"links":{"cited_paper":"/paper/2411.11694","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:c601f5ee2af598f1155335e529063124123b5a86a19feac565789d6534e08f5e","observation_id":"6185c839-4d9e-40cb-b798-ea7dcb445a4a","resolution":{"observed_at":"2026-08-11T11:40:13.585941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-11T11:40:13.592042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.592042Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:739c61aba97e62889b7472d81d3f998705f0ab86cac7a4101255522fc6136a51","observation_id":"ee75d066-34ed-4619-ba8c-90d85fa80f1d","resolution":{"observed_at":"2026-08-11T11:40:13.592042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00658","last_updated":"2024-10-15T09:16:38Z","snapshot_observed_at":"2026-08-09T17:46:02.167914Z","submitted_at":"2024-02-01T15:18:33Z","title":"Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00658","snapshot_observed_at":"2026-08-11T11:40:13.597847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.597847Z"},"links":{"cited_paper":"/paper/2402.00658","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:62d71070fa521144ee293d98e11fdf1eb165f55dde055e35b49bf1973a4e55e6","observation_id":"7fd0cef1-7967-4e70-b4d2-e75dd1d7d11b","resolution":{"observed_at":"2026-08-11T11:40:13.597847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-11T11:40:13.603785Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.603785Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:517364b710cb0ee13d503161c7877773d77d616a58bb83a7a808b6fda681cf45","observation_id":"a4031fc0-eddf-4762-b4a3-236bd58844fd","resolution":{"observed_at":"2026-08-11T11:40:13.603785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T11:40:13.609436Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.609436Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:1becc20645534171d7bacbed7f62ef392cb9df44c244c1cfd9b10c69d10ff654","observation_id":"393e36fc-0f3a-42fd-a4f8-558e0697a9ec","resolution":{"observed_at":"2026-08-11T11:40:13.609436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.615782Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.615782Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:16b82c79af5519c9cec68f08105a8ded6b4bd9f8d758a55767e4b55916aeb9d9","observation_id":"ac1f2851-cec7-47fc-b596-79d03e25d699","resolution":{"observed_at":"2026-08-11T11:40:13.615782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.622100Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.622100Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:97f54ee13ad79deea1755c30e8b8a71575ba992932a1cc64ea64a19dc46905bb","observation_id":"2e669c07-0139-44e9-8c45-7f9f8c7a26cc","resolution":{"observed_at":"2026-08-11T11:40:13.622100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.629645Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.629645Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:ad6598d53aee8d43d62880758ef3d41080540fea8edde01e85677814ccc53dcc","observation_id":"07974324-4987-4663-a2bd-1bdd78ef541c","resolution":{"observed_at":"2026-08-11T11:40:13.629645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.638370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.638370Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:0062045e64e3089e97f672bfa6a241d2c4387ae363780b18f22ee62d5cf6c74d","observation_id":"3cde1b08-41f2-4dee-9ca0-237479debd84","resolution":{"observed_at":"2026-08-11T11:40:13.638370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17589","last_updated":"2024-01-29T02:11:01Z","snapshot_observed_at":"2026-07-06T16:39:04.459332Z","submitted_at":"2023-10-26T17:11:42Z","title":"An Open Source Data Contamination Report for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17589","snapshot_observed_at":"2026-08-11T11:40:13.645069Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.645069Z"},"links":{"cited_paper":"/paper/2310.17589","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:46e87face0a217478e7dac8c4f69bf2f977aa6672fca6b72aceac19320ab6961","observation_id":"6dfbb20a-0715-49c3-a026-2e69695dcebd","resolution":{"observed_at":"2026-08-11T11:40:13.645069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T13:05:29.313402Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-11T11:40:13.651621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.651621Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:a4b49ce3f490b6ad12c4e708dfbee9af360be8e253dbfd97166829f30bc2002b","observation_id":"b6427d9d-7f28-4019-b73f-21c5aa7f21b0","resolution":{"observed_at":"2026-08-11T11:40:13.651621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01448","last_updated":"2023-10-19T02:46:07Z","snapshot_observed_at":"2026-08-11T05:39:30.558321Z","submitted_at":"2023-10-01T15:06:51Z","title":"Meta Semantic Template for Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.01448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01448","snapshot_observed_at":"2026-08-11T11:40:14.562594Z","title":"Meta Semantic Template for Evaluation of Large Language Models","venue":"cs.CL","work_id":"b59d3250-d019-498d-99bb-cd61825e06ae","year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.657860Z"},"links":{"cited_paper":"/paper/2310.01448","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:5a49f8db3d5c4fb4e2a2e4e41f8cf26dccbc63090c1c795baea7a78deb1953bf","observation_id":"c8b105cd-79aa-482b-81db-f3865c31ebf7","resolution":{"observed_at":"2026-08-11T11:40:14.570216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-11T11:40:13.663576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.663576Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:59e5f5903454c7d7bf096457d55adfd45a35542828740525f1d630de033cb8f2","observation_id":"bf101bc8-f64e-4684-b1b5-bac166598201","resolution":{"observed_at":"2026-08-11T11:40:13.663576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-08-10T06:54:39.880929Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-11T11:40:13.668726Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.668726Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:1a5f886c4794005dca6658b2cbee9667a7454a7510e08f44f323912db2340c91","observation_id":"63ea4412-c884-4f80-b341-8e80de917850","resolution":{"observed_at":"2026-08-11T11:40:13.668726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07565","last_updated":"2024-10-03T16:48:55Z","snapshot_observed_at":"2026-08-04T18:31:06.905572Z","submitted_at":"2024-07-10T11:50:20Z","title":"On Leakage of Code Generation Evaluation Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07565","snapshot_observed_at":"2026-08-11T11:40:13.674987Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.674987Z"},"links":{"cited_paper":"/paper/2407.07565","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:41bbdd6248ace05e1ac761f4500aee8043b0f2414c3d3ed2fb786c17d6e18184","observation_id":"2058e9b4-805b-45fe-90bc-afaf688edf9b","resolution":{"observed_at":"2026-08-11T11:40:13.674987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.680366Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.680366Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:9e0a47612459ffd7b86b9e6c8621d56372b500c226459054fec82420e22ae8c8","observation_id":"4af0652d-564d-40b5-b3d6-3f917a5a24c6","resolution":{"observed_at":"2026-08-11T11:40:13.680366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:40:13.685597Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.685597Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:ea75cb2e0291fa3c39dced54cf7a482e964815175e5a53804b4a50e1d36cd8db","observation_id":"15945208-273c-4e3e-93de-729bdcb54d2e","resolution":{"observed_at":"2026-08-11T11:40:13.685597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.690817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.690817Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:b6e72a7221c4006c264adddf8b6e30c1c133122b1f6c96ff66aa42fe5f5055cc","observation_id":"e6209555-9d88-4aea-915b-8a9ec2cacd6c","resolution":{"observed_at":"2026-08-11T11:40:13.690817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.695577Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.695577Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:d3827432839be66e2cccdc7e19fbfac09a8e5cd43854dea0f3fafe523cdedf9c","observation_id":"08237f47-4d3b-4546-b0d3-75185af396ce","resolution":{"observed_at":"2026-08-11T11:40:13.695577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-11T11:40:13.701281Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.701281Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:8edc1b82352a64ebbfef9cf01a0b55f2b3993265c53a950e1fe2d6a442b867cb","observation_id":"20e37970-b2e6-4598-851d-e685c6954938","resolution":{"observed_at":"2026-08-11T11:40:13.701281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.707344Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.707344Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:02f9a0338d1b0a0b4a33cc379bbe45e190ed7ae597a855f3b253b5014fb070fc","observation_id":"5580dfb0-741e-4c89-9fe9-8e88a02e9f5c","resolution":{"observed_at":"2026-08-11T11:40:13.707344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-11T11:40:13.712702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.712702Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:c679e0a5b89b2a181cb356cd48c04bbcbab1c37db39d0be725583c360c4a2e8d","observation_id":"2bd6778b-26b4-4a5b-8dd4-f8ae8b2183dc","resolution":{"observed_at":"2026-08-11T11:40:13.712702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.718272Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.718272Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:298c417d9484d468e129e4a24945df658d7e66c3d28ccb001fe7b300695b1867","observation_id":"14ca6ecd-a7e0-4276-b2b8-deeb8e6d1ae2","resolution":{"observed_at":"2026-08-11T11:40:13.718272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.724209Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.724209Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:154364e8f4933dc77eb7be7eb013a1836ca7662fc7a2f1b85e8232aeedf15ac3","observation_id":"b1929ca5-01e2-4bd6-8e38-807a34bc61ba","resolution":{"observed_at":"2026-08-11T11:40:13.724209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.730809Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.730809Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:dd1c1ae444e48bac02d9f78a877a5555264f3a6bc74de178b53170222d05e580","observation_id":"a850b654-297f-4255-a6ed-2c197fdd104b","resolution":{"observed_at":"2026-08-11T11:40:13.730809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.736045Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.736045Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:17aa3f80edd514f0289d3f2c1c6a09fe9968d6aff24b7fab0373405a2d85c145","observation_id":"ac13238f-0f06-4570-9d7b-daa90fe4f159","resolution":{"observed_at":"2026-08-11T11:40:13.736045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04811","last_updated":"2024-03-06T21:45:35Z","snapshot_observed_at":"2026-08-09T02:53:12.730289Z","submitted_at":"2024-03-06T21:45:35Z","title":"Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04811","snapshot_observed_at":"2026-08-11T11:40:13.741946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.741946Z"},"links":{"cited_paper":"/paper/2403.04811","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:a7c3b8c67012f093f0f3328a6ee866ac089367fed7abe698ca2b7e1a661607ac","observation_id":"c18b0ef1-d468-4300-b5da-820f8aeabcdc","resolution":{"observed_at":"2026-08-11T11:40:13.741946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18018","last_updated":"2023-10-27T09:48:29Z","snapshot_observed_at":"2026-08-10T20:00:19.698973Z","submitted_at":"2023-10-27T09:48:29Z","title":"NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18018","snapshot_observed_at":"2026-08-11T11:40:13.747358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.747358Z"},"links":{"cited_paper":"/paper/2310.18018","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:0b8c7923db9bd2f928479aac444a204a1f960ed4f253fb3dc739b85e840032dd","observation_id":"8bee9f43-dcec-4be2-8492-3dbce3ee2990","resolution":{"observed_at":"2026-08-11T11:40:13.747358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-11T11:40:13.752799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.752799Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:10d54943b5f7d426ff270255b1fe4afb12eb296e0f9227fab102665a32ae8dd7","observation_id":"63aa9c1b-7836-47ec-b3b1-6a2b0d540ee0","resolution":{"observed_at":"2026-08-11T11:40:13.752799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.758402Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.758402Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:38deedcfc5f05e891c215e4987661658727d864b478c1f1404709a9608d1227c","observation_id":"fbe26c91-494d-4cd4-ab6f-79e3f0cb32c2","resolution":{"observed_at":"2026-08-11T11:40:13.758402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-11T11:40:13.763961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.763961Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:8387e2e1f200fdc9a3c275351ced3b0505e3f043898d0c3595050866e1584469","observation_id":"bfe8fd6e-b055-490b-bfc0-6fe771d47094","resolution":{"observed_at":"2026-08-11T11:40:13.763961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08115","last_updated":"2024-08-03T21:25:31Z","snapshot_observed_at":"2026-08-10T01:47:55.445525Z","submitted_at":"2024-02-12T23:11:01Z","title":"On the Self-Verification Limitations of Large Language Models on Reasoning and Planning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08115","snapshot_observed_at":"2026-08-11T11:40:13.768870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.768870Z"},"links":{"cited_paper":"/paper/2402.08115","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:6d8620b1f59daf7f044755ec62123995fa522bc1229a97cbf4748c2277de6323","observation_id":"b0862f90-c68e-4f08-b481-a138e64786dc","resolution":{"observed_at":"2026-08-11T11:40:13.768870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.530013Z","title":null,"venue":null,"work_id":"37f603b0-277f-4cdc-8674-222cd91976d1","year":2019},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.774419Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:0dd78281c57ee1f0690f7f1d759d49700b5fe995750d1996a506270cebe8c800","observation_id":"a23c88d4-eddc-4a1c-9635-9ac03d8cde51","resolution":{"observed_at":"2026-08-11T11:40:15.535541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.779711Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.779711Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:6c21e27d6c312859ce207447be63811bee7a4c45bc2d868f75478bcf3f94b2e0","observation_id":"264fa6b7-655f-4d66-9682-926a970e593a","resolution":{"observed_at":"2026-08-11T11:40:13.779711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-11T11:40:13.784558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.784558Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:5a8715db8380e7127e58a59b719b8ddc892b013f1a3562c3bb2c8349e982c414","observation_id":"4ad801e4-71e0-44e9-bd03-b0ea41956fb3","resolution":{"observed_at":"2026-08-11T11:40:13.784558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T11:40:13.790258Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.790258Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:128f9f6f6be16ba4deb8f616f26d1a8440fbc973d50ef2e52fe1bf3b5c6fc2a7","observation_id":"ec22dddc-6227-43ce-bedc-20b547d0a87a","resolution":{"observed_at":"2026-08-11T11:40:13.790258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T11:40:13.795348Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.795348Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:840386f60d849c009945da6b51dae571532c49f8d4f3805302ab04bad20880e6","observation_id":"db5436e3-6fe1-409b-bcad-8ff00ed1b358","resolution":{"observed_at":"2026-08-11T11:40:13.795348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.501520Z","title":"O'Reilly Media, Inc","venue":null,"work_id":"d0297f15-61a3-40b1-9059-3f3447e4150e","year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.800648Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:509e849da00897c0f6eed33f57f2977d7a7eb3cac830edca766ecad637556ad7","observation_id":"8f54e275-f0f6-4c91-9d4b-c57c7f884569","resolution":{"observed_at":"2026-08-11T11:40:15.506648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.484802Z","title":null,"venue":null,"work_id":"c60e85e2-b1d2-4687-9864-2e1a2e851452","year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.805621Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:68ad70fe88d5ea57d3c3923669fcddda018f07bafbfe6d9ded39d88375908355","observation_id":"32697a24-177a-4297-8ae0-ef41e45f7d0a","resolution":{"observed_at":"2026-08-11T11:40:15.490111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.810982Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.810982Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:ce1a29b73c6a4f2ec7c0a45aa26e46202c08eb0e27e8337fa6c2b080589d2817","observation_id":"71e3acb8-cfef-40a7-8530-a8ade31f8ff5","resolution":{"observed_at":"2026-08-11T11:40:13.810982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.457860Z","title":null,"venue":null,"work_id":"a82a72f2-ed37-4272-b2d2-957ce7eceb2c","year":2018},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.816210Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:750eb1c10178546a4d912f65a544706d53ed1476206997784f0b5c55510a166a","observation_id":"38bb94fe-32ae-46db-b1d3-74ec00e204d9","resolution":{"observed_at":"2026-08-11T11:40:15.463141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00320","last_updated":"2024-06-29T05:14:04Z","snapshot_observed_at":"2026-08-06T10:09:18.664387Z","submitted_at":"2024-06-29T05:14:04Z","title":"LiteSearch: Efficacious Tree Search for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00320","snapshot_observed_at":"2026-08-11T11:40:13.821121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.821121Z"},"links":{"cited_paper":"/paper/2407.00320","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:99c4931fc97575ba0ec8b2612164eefef85b7408c1e654484362ae2ca3d4ec2d","observation_id":"ad2f1259-4227-4913-9767-f5930e584838","resolution":{"observed_at":"2026-08-11T11:40:13.821121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07521","last_updated":"2023-12-16T12:47:19Z","snapshot_observed_at":"2026-08-10T11:54:40.273336Z","submitted_at":"2023-10-11T14:18:03Z","title":"Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07521","snapshot_observed_at":"2026-08-11T11:40:13.826193Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.826193Z"},"links":{"cited_paper":"/paper/2310.07521","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:8704a061417d977bc224edab44c1672e7551d96b55661ab40197452961479f4b","observation_id":"fb6e278f-ed16-422d-98d7-ca0b3dd8de81","resolution":{"observed_at":"2026-08-11T11:40:13.826193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-08T14:45:36.681932Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-11T11:40:13.831745Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.831745Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:aef25e3fb97c972a3879b7114f6597150854338b059ed54beb3ccf095b54f773","observation_id":"1a40f116-9eec-4c21-85f3-b61566470e12","resolution":{"observed_at":"2026-08-11T11:40:13.831745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-11T11:40:13.837438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.837438Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:21b8a1a9d39b305e068d18383d38c5d8c87d3bbc038bf69461caf74c1683a45c","observation_id":"c75ed5a7-93c1-4fbb-af81-d44735a28339","resolution":{"observed_at":"2026-08-11T11:40:13.837438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.440434Z","title":null,"venue":null,"work_id":"06a00b68-07bb-491e-b653-115339371fc7","year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.843931Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:19356c9b1e728b28f2aa5693002edcf14df2fd84f1577c3eac4dc336ac6d4643","observation_id":"159e4030-edab-4a16-9265-e72cdff72edb","resolution":{"observed_at":"2026-08-11T11:40:15.445894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.421922Z","title":null,"venue":null,"work_id":"73862dd6-5064-4b59-82a5-456106999612","year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.849481Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:fab7a3c5ded2f5c8aa58dbf8f96554887042aad5baedba000bb2f45370563cf6","observation_id":"f6a00e54-171b-4f3e-81b9-cd8531abd3df","resolution":{"observed_at":"2026-08-11T11:40:15.427496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-07T12:09:31.277517Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-11T11:40:13.855139Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.855139Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:8a396261fe12be1d23796d177b5d854e6f9203af05cf5bdc5105303c29cc72c7","observation_id":"bfede6a1-675d-4638-943a-23621287a16e","resolution":{"observed_at":"2026-08-11T11:40:13.855139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-11T11:40:13.860596Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.860596Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:1fdc8fabb15ed07a3c0c850fc65fda20cab2f8c360a450cb14f3def829bb9cba","observation_id":"438d267f-5880-46e6-9d58-8d3fd5e5e99a","resolution":{"observed_at":"2026-08-11T11:40:13.860596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02658","last_updated":"2024-10-14T19:33:00Z","snapshot_observed_at":"2026-08-11T14:55:25.725642Z","submitted_at":"2024-02-05T00:57:51Z","title":"Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02658","snapshot_observed_at":"2026-08-11T11:40:13.865853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.865853Z"},"links":{"cited_paper":"/paper/2402.02658","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:17693f02ba285186da2fec75796ad6582727e182e57bc24eeeaa700870890437","observation_id":"8801108c-3171-4f01-ad1f-724db8663534","resolution":{"observed_at":"2026-08-11T11:40:13.865853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.870917Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.870917Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:87b886ba3676355f7fba3baee2ab555220319afd63a451c264065ddc8d34d615","observation_id":"b6765415-6822-46f7-942d-58f02dcf96c0","resolution":{"observed_at":"2026-08-11T11:40:13.870917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15747","last_updated":"2024-03-23T07:29:41Z","snapshot_observed_at":"2026-08-05T20:25:09.203299Z","submitted_at":"2024-03-23T07:29:41Z","title":"CodeShell Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15747","snapshot_observed_at":"2026-08-11T11:40:13.876078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.876078Z"},"links":{"cited_paper":"/paper/2403.15747","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:c23cd211020e6223790f1a9487bdc0da126c235cb9ddb268f357f76c856bcbaa","observation_id":"1c7dc39a-38f4-4129-8af0-d0d2aaecc3e3","resolution":{"observed_at":"2026-08-11T11:40:13.876078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11176","last_updated":"2024-09-24T10:01:31Z","snapshot_observed_at":"2026-08-01T17:35:58.677762Z","submitted_at":"2024-06-17T03:29:13Z","title":"Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11176","snapshot_observed_at":"2026-08-11T11:40:13.881355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.881355Z"},"links":{"cited_paper":"/paper/2406.11176","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:c3efe06d3f8c8c93b220c9bb758b563addc32809873af899d2365c1427bbd6fa","observation_id":"51193056-39d4-4b0c-8ed2-3b0bb6ff4a87","resolution":{"observed_at":"2026-08-11T11:40:13.881355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08073","last_updated":"2023-05-22T11:55:52Z","snapshot_observed_at":"2026-07-06T14:18:30.314936Z","submitted_at":"2022-11-15T11:53:55Z","title":"GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08073","snapshot_observed_at":"2026-08-11T11:40:13.886611Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.886611Z"},"links":{"cited_paper":"/paper/2211.08073","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:e047309165e3fc96d84c8f00e2f86c4578932190f070f845c81d484b4389a0d1","observation_id":"8424e32a-a3de-4ffa-b582-5b09185da12c","resolution":{"observed_at":"2026-08-11T11:40:13.886611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15918","last_updated":"2024-04-11T06:41:15Z","snapshot_observed_at":"2026-07-06T17:08:00.380938Z","submitted_at":"2023-12-26T07:24:46Z","title":"Supervised Knowledge Makes Large Language Models Better In-context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15918","snapshot_observed_at":"2026-08-11T11:40:13.891905Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.891905Z"},"links":{"cited_paper":"/paper/2312.15918","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:75dd8287905bebbef2309b9b8e38bc89f340c262778c04d8e1a7d05f3ef3b6f0","observation_id":"46f96e20-fa5d-40a0-b1ad-bcf95afe31bd","resolution":{"observed_at":"2026-08-11T11:40:13.891905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:15.394384Z","title":null,"venue":null,"work_id":"492ff5f1-7aa7-4fad-905a-966e8268f3bc","year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.897076Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:29ffe8f3494b06045170628f4e28fae95576c216ad080a36690e299c9ed865c1","observation_id":"409370a7-37e9-4592-8142-4f04cb7d625f","resolution":{"observed_at":"2026-08-11T11:40:15.399530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15043","last_updated":"2024-06-03T06:02:39Z","snapshot_observed_at":"2026-08-10T01:47:48.554344Z","submitted_at":"2024-02-23T01:30:39Z","title":"KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15043","snapshot_observed_at":"2026-08-11T11:40:13.902661Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.902661Z"},"links":{"cited_paper":"/paper/2402.15043","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:24849395db5d3066d77771bbc51ba913ca4ea9f6aa8f85080bd34bc697e1f904","observation_id":"168a38d8-d0e8-4935-9cf4-2928fc98de1f","resolution":{"observed_at":"2026-08-11T11:40:13.902661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06003","last_updated":"2024-04-09T04:17:51Z","snapshot_observed_at":"2026-08-04T18:55:08.786293Z","submitted_at":"2024-04-09T04:17:51Z","title":"FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06003","snapshot_observed_at":"2026-08-11T11:40:13.907632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.907632Z"},"links":{"cited_paper":"/paper/2404.06003","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:391e7116b3f2800201685a60f00d63103f18fd96e4a8d79a75b8e051982c93c5","observation_id":"7dca7866-e9b6-499c-960e-481489b1c060","resolution":{"observed_at":"2026-08-11T11:40:13.907632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-11T11:40:13.912864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.912864Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:f957d9f6f166767b51a62d2c6911e29a50d54089484c62623be3671ba7a59f7b","observation_id":"44145f61-6d57-4e46-b63e-bd490181b2cc","resolution":{"observed_at":"2026-08-11T11:40:13.912864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04087","last_updated":"2023-09-11T06:27:53Z","snapshot_observed_at":"2026-07-06T15:24:07.662207Z","submitted_at":"2023-05-06T16:12:19Z","title":"Self-Edit: Fault-Aware Code Editor for Code Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04087","snapshot_observed_at":"2026-08-11T11:40:13.918207Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.918207Z"},"links":{"cited_paper":"/paper/2305.04087","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:edacc241a5cf306a5cb25a78e4e6e214e3e7d4d8046740499a281a1f8dcf896c","observation_id":"4d04ced9-301d-491b-b09b-03dd2e75241a","resolution":{"observed_at":"2026-08-11T11:40:13.918207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:40:13.923794Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.923794Z"},"links":{"citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:902e81c9b22c3139d8adcde980df993c95d76b3bf62b57d163346245be891c2e","observation_id":"eea1c3be-2348-4fce-8645-6c5714fd2147","resolution":{"observed_at":"2026-08-11T11:40:13.923794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-11T11:40:13.929186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T11:40:13.929186Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2412.15118"},"observation_digest":"sha256:afd66c18b965fad7fdbb1900852b24695858c37827b4f16665be1472581a012c","observation_id":"2d0d6d59-2602-4195-9925-7553791389f7","resolution":{"observed_at":"2026-08-11T11:40:13.929186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15118","last_updated":"2025-06-06T12:13:42Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T11:34:33.187431Z","submitted_at":"2024-12-19T17:59:42Z","title":"Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 8 inbound Pith citation observations for arXiv:2412.15118."}