{"as_of":"2026-08-21T08:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b98d46c7dc2858d7eab6b9aa25693b9e0fda86b80f3d3bbe8b136a6fd3aeb1e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:17.249805Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-12T17:10:55.447728Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12882","last_updated":"2025-06-06T05:27:10Z","snapshot_observed_at":"2026-08-15T15:30:04.308785Z","submitted_at":"2024-11-19T22:00:01Z","title":"ProSec: Fortifying Code LLMs with Proactive Security Alignment","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T17:10:55.447728Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2411.12882"},"observation_digest":"sha256:eb0729e6a062146a2e7c436ef7f75099fd6a42b0ee5fb392d3ac7b737b90bb78","observation_id":"97c36278-9d4c-4032-bfe0-f980622569b1","resolution":{"observed_at":"2026-08-12T17:10:55.447728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-10T21:51:07.835200Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03884","last_updated":"2025-05-30T04:56:02Z","snapshot_observed_at":"2026-08-14T02:18:54.465541Z","submitted_at":"2025-01-07T15:46:42Z","title":"AlphaPO: Reward Shape Matters for LLM Alignment","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:51:07.835200Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2501.03884"},"observation_digest":"sha256:1322c2e418cfe900916e244a50f5718c96c301d75f715455f3a2d8e23e346df3","observation_id":"a9639fc7-815e-4410-a095-b720063636ae","resolution":{"observed_at":"2026-08-10T21:51:07.835200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:914ce66bb3a37f686b402613f2b608fb107ea120e7f0b05c889c3eb7326c7f95","observation_id":"91e1c7b4-1331-4b0d-8ee6-10cdad3b9da5","resolution":{"observed_at":"2026-05-15T21:20:59.399537Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-09T14:53:49.690579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01718","last_updated":"2025-05-24T04:36:48Z","snapshot_observed_at":"2026-08-14T06:10:00.978457Z","submitted_at":"2025-02-03T18:46:04Z","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:53:49.690579Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2502.01718"},"observation_digest":"sha256:f382ab793c7ff216b4ca19c15a7a83fd2b3bbdc9cc7a7f60ecaed258d2bbe4c5","observation_id":"689841cb-aab3-40e6-af6c-213939b0fd53","resolution":{"observed_at":"2026-08-09T14:53:49.690579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-08-13T07:37:18.494967Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T10:27:56.185943Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2502.18449"},"observation_digest":"sha256:5acedc80ad11d95b61153f1714fe4f7f888784c7353f5517387e711f9934a043","observation_id":"4f86d814-6f5b-4ad7-a836-828d61c88d09","resolution":{"observed_at":"2026-05-15T10:27:56.341144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-08T15:14:54.193857Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2503.05703","last_updated":"2025-02-10T14:42:13Z","snapshot_observed_at":"2026-08-12T14:00:08.225974Z","submitted_at":"2025-02-10T14:42:13Z","title":"What I cannot execute, I do not understand: Training and Evaluating LLMs on Program Execution Traces","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T15:14:54.193857Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2503.05703"},"observation_digest":"sha256:9880604737c98f1666f5cd7776128e65e16db0ff9934c74013d0b9dae9fc0aa7","observation_id":"404dd99f-12dc-46b2-bc31-ea15c2f6cafe","resolution":{"observed_at":"2026-08-08T15:14:54.193857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:a2bcf508a49f7a285f2b3d8bc112c024f157bbc1bad3c9c43c6094d244f5114f","observation_id":"dfd6e967-1c5b-4d72-be45-fe8404b61f48","resolution":{"observed_at":"2026-05-12T08:41:23.564056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:76b0e0e3d6b1d2dfff33cdb85dac37b6243627e1e12e3c16e14859a184d631cf","observation_id":"43bae483-6515-488d-813f-dedbbcfb33ce","resolution":{"observed_at":"2026-05-22T22:22:12.170943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-16T12:40:17.249805Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12216","last_updated":"2025-06-03T17:02:25Z","snapshot_observed_at":"2026-08-19T23:20:06.183863Z","submitted_at":"2025-04-16T16:08:45Z","title":"d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:17.249805Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.12216"},"observation_digest":"sha256:c1a584f9f7cc33700ee8779d6e2040d8c3ba7bc4982b9c711d016a32fd80c1c7","observation_id":"aed3e921-9a1d-4c03-862b-3803fd15b4a2","resolution":{"observed_at":"2026-08-16T12:40:17.249805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-16T12:39:09.591657Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12365","last_updated":"2025-04-16T16:07:18Z","snapshot_observed_at":"2026-08-17T14:38:39.304507Z","submitted_at":"2025-04-16T16:07:18Z","title":"Themisto: Jupyter-Based Runtime Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T12:39:09.591657Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.12365"},"observation_digest":"sha256:3c1fb12fff73ae77e85a733b1b39ed2d2549fe5bf63fb06771a9a933069f1f5c","observation_id":"cd65e293-366e-4696-91f7-50f144370466","resolution":{"observed_at":"2026-08-16T12:39:09.591657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-16T12:27:55.152640Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:e7223a6d05aba7b5cfe70bb3b2e429a922972e0889ef57a72ddf56ab9eae9b67","observation_id":"c56626ec-d521-44db-b591-9947b9a4ba79","resolution":{"observed_at":"2026-05-22T19:32:00.981090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-16T12:33:20.515021Z","title":"RLEF: Grounding code LLMs in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-16T12:27:55.152640Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":11},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:20.515021Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:62434e87cd2c07acb59586fedac187327bc75ef730cbedc471926d5e28f8bced","observation_id":"450fdcf1-762c-496f-9437-fde06d88c6da","resolution":{"observed_at":"2026-08-16T12:33:20.515021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-16T12:18:12.210307Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13178","last_updated":"2025-08-05T13:29:54Z","snapshot_observed_at":"2026-08-18T18:04:50.345602Z","submitted_at":"2025-04-17T17:59:54Z","title":"Aligning Constraint Generation with Design Intent in Parametric CAD","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:12.210307Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.13178"},"observation_digest":"sha256:b5a328065408cd1043fb88911e2d80194a6bdf09c79a6a2dc2fb52049f043762","observation_id":"219f6c5b-4ee5-462c-9e17-3cd06d722d74","resolution":{"observed_at":"2026-08-16T12:18:12.210307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-16T00:45:04.892077Z","title":"Gehring, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02931","last_updated":"2025-05-05T18:06:51Z","snapshot_observed_at":"2026-08-18T21:57:08.264292Z","submitted_at":"2025-05-05T18:06:51Z","title":"The Art of Repair: Optimizing Iterative Program Repair with Instruction-Tuned Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:45:04.892077Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.02931"},"observation_digest":"sha256:fd2e5e444f37ac3673fd2820d904c73767bdb20f15e566dcc53321f2421a5860","observation_id":"b7b590a6-db9c-4d15-9e3e-03b5f9ac56fe","resolution":{"observed_at":"2026-08-16T00:45:04.892077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T13:35:50.613928Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.613928Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:389e38e76b11ffa93ff27a964ead576cd558bdadea4571bb611c86539cd340d4","observation_id":"41cd47ac-0822-4c76-8982-68592cfe2bbc","resolution":{"observed_at":"2026-08-07T13:35:50.613928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T13:04:58.623446Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22704","last_updated":"2025-05-28T17:57:47Z","snapshot_observed_at":"2026-08-18T06:45:54.100831Z","submitted_at":"2025-05-28T17:57:47Z","title":"Training Language Models to Generate Quality Code with Program Analysis Feedback","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:58.623446Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.22704"},"observation_digest":"sha256:8fdc777856d2b0866ebd440d0751619aa455a459c1401b13f1ce8c0389e0eec4","observation_id":"484deb15-1a48-4b08-a34d-273bc18125e1","resolution":{"observed_at":"2026-08-07T13:04:58.623446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T12:50:24.815311Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23387","last_updated":"2025-06-03T09:55:22Z","snapshot_observed_at":"2026-08-18T06:32:15.294150Z","submitted_at":"2025-05-29T12:14:29Z","title":"Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.815311Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.23387"},"observation_digest":"sha256:00ad3d99547ffbf7106c2d31b1b1bb70b181a4b1169f23c7e52d4b08d855053d","observation_id":"5badb4da-5bed-4308-8c0b-fd622e9b4717","resolution":{"observed_at":"2026-08-07T12:50:24.815311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T12:45:25.658504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-13T20:34:22.010534Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.658504Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:fd7202297a2571b71d7d9307759b3cdef53a9a297cf0c3255307515351f75ca6","observation_id":"1aff602b-b69d-462f-8792-7d66865a4e5d","resolution":{"observed_at":"2026-08-07T12:45:25.658504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T11:31:53.421299Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-19T06:15:05.397467Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.421299Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:805b898a3941facf0482cb784ea8972efe9a43151582cac5c8456c812e8252a4","observation_id":"42e8fd50-6085-47b2-9879-b8b77ad352ed","resolution":{"observed_at":"2026-08-07T11:31:53.421299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T00:31:36.562765Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.562765Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1f03eef25c5257d59261ad40acec1d2376de75842d471616fc2074998af97d00","observation_id":"43b36156-2531-46f0-b9dd-afe892cd943c","resolution":{"observed_at":"2026-08-07T00:31:36.562765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T04:37:29.805270Z","title":"arXiv preprint arXiv:2410.02089 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.805270Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:3841999759e0e327184562ddccb8c72b02eeac3a545a792a961bfe33ca7dc1c9","observation_id":"3b9a162a-60ac-446a-8ddc-30c8f0d508da","resolution":{"observed_at":"2026-08-07T04:37:29.805270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T21:12:41.213688Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10059","last_updated":"2025-09-02T20:11:20Z","snapshot_observed_at":"2026-08-18T02:08:20.600201Z","submitted_at":"2025-08-12T22:03:54Z","title":"CodeGrad: Integrating Multi-Step Verification with Gradient-Based LLM Refinement","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:12:41.213688Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2508.10059"},"observation_digest":"sha256:b886e020836fdcc41bb8bdd551073a2d4a401cba00e28d6b9ca09e4c7445e069","observation_id":"9b939a93-5116-451a-b01f-0489329ea5b0","resolution":{"observed_at":"2026-08-05T21:12:41.213688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T16:28:23.056538Z","title":"Gehring, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18462","last_updated":"2025-08-25T20:20:44Z","snapshot_observed_at":"2026-08-14T17:38:54.470556Z","submitted_at":"2025-08-25T20:20:44Z","title":"VERIRL: Boosting the LLM-based Verilog Code Generation via Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:28:23.056538Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2508.18462"},"observation_digest":"sha256:3a518a866ca9381fb313614faa531a6c669b3296993cdfe2e09837fc87a0e0c1","observation_id":"ea83a352-454f-448a-810f-8d2cc060d73a","resolution":{"observed_at":"2026-08-05T16:28:23.056538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2509.24552","last_updated":"2026-05-04T14:21:45Z","snapshot_observed_at":"2026-08-19T07:30:20.382646Z","submitted_at":"2025-09-29T10:04:12Z","title":"Short window attention enables long-term memorization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T12:10:42.646127Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2509.24552"},"observation_digest":"sha256:69d17d6f9ac3e70c679694eb4de1a07e8e969c4e77926f4bddd3e4bf955521ab","observation_id":"97650b8c-9389-4fae-9456-c96ce892e39f","resolution":{"observed_at":"2026-05-18T12:11:21.813433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-03T13:45:23.514060Z","title":"Corresponding authors: Aram Markosyan, Mark Saroufim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23236","last_updated":"2026-07-06T22:18:07Z","snapshot_observed_at":"2026-08-19T23:34:54.822557Z","submitted_at":"2025-12-29T06:31:55Z","title":"KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:45:23.514060Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2512.23236"},"observation_digest":"sha256:051e7bd2ed6c49325b355e7fb94048121e19d404923623a68cfa438a7329075b","observation_id":"9651214a-fb95-4701-9ae9-a09d438c2181","resolution":{"observed_at":"2026-08-03T13:45:23.514060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-03T12:19:31.452883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-19T23:13:10.681492Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:31.452883Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:983600b14b8c1031dc95c99335e97f3ea0b825972a849c007e88dba2789a75c8","observation_id":"ba509e48-0377-4279-bbfb-229312551200","resolution":{"observed_at":"2026-08-03T12:19:31.452883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-13T10:38:11.981408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04236","last_updated":"2026-04-05T19:36:51Z","snapshot_observed_at":"2026-08-17T10:16:22.161308Z","submitted_at":"2026-04-05T19:36:51Z","title":"NEURA: A Unified and Retargetable Compilation Framework for Coarse-Grained Reconfigurable Architectures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T10:38:11.981408Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.04236"},"observation_digest":"sha256:66c85074307afe09a449694b653ec6bbdfd2395b6c3b32738829698b25654a6f","observation_id":"6f6b0ecb-48a8-4d63-a242-e6c291cdc467","resolution":{"observed_at":"2026-07-13T10:38:11.981408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.04580","last_updated":"2026-04-06T10:26:46Z","snapshot_observed_at":"2026-08-16T20:04:45.017123Z","submitted_at":"2026-04-06T10:26:46Z","title":"Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:12:53.062214Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.04580"},"observation_digest":"sha256:10904b8bf8289174d7aef825cd7fc21f2151811d42553c6e3927942465b60130","observation_id":"b38a1b66-17ac-4be1-844c-5a99239250b9","resolution":{"observed_at":"2026-05-10T22:10:47.874733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.05560","last_updated":"2026-06-30T13:49:36Z","snapshot_observed_at":"2026-08-12T21:37:55.938738Z","submitted_at":"2026-04-07T08:00:54Z","title":"An Iterative Test-and-Repair Framework for Competitive Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:44:32.950977Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.05560"},"observation_digest":"sha256:73c58cc52a3866d82d5b313371dd98d622aef50f8df961180a28d63223c7ef52","observation_id":"f5e72726-7d9c-4e30-9322-09cbe9cfdc61","resolution":{"observed_at":"2026-05-10T22:35:48.523439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-13T09:22:44.557413Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.05560","last_updated":"2026-06-30T13:49:36Z","snapshot_observed_at":"2026-08-12T21:37:55.938738Z","submitted_at":"2026-04-07T08:00:54Z","title":"An Iterative Test-and-Repair Framework for Competitive Code Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T09:22:44.557413Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.05560"},"observation_digest":"sha256:0c9c534c890654681fc55758fa6f2c3dbba785dcc86ada2b41b1b7d063b84121","observation_id":"98fd10ca-0dbe-4f9b-bc8d-ac1fcde25d4e","resolution":{"observed_at":"2026-07-13T09:22:44.557413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.06079","last_updated":"2026-04-07T16:58:14Z","snapshot_observed_at":"2026-08-16T00:33:35.993032Z","submitted_at":"2026-04-07T16:58:14Z","title":"Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:45:40.915428Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.06079"},"observation_digest":"sha256:d103cc7623bad8a2893f10de5ddbb679b419c332917c7ad3142a94db1cfcebf6","observation_id":"b6d7d84f-326b-455e-8077-d709f2e0fac7","resolution":{"observed_at":"2026-05-10T22:30:53.249113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-08-19T21:18:38.649860Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:7cf1f85e0e8b150186f5e09426df0c833e0d6d4c1e43134f0555f8bdff4e9514","observation_id":"1027fdd9-2fe5-4d0a-8b08-6c6c3423f5e0","resolution":{"observed_at":"2026-05-11T06:15:58.374374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.16335","last_updated":"2026-03-13T02:23:49Z","snapshot_observed_at":"2026-08-15T23:44:48.099064Z","submitted_at":"2026-03-13T02:23:49Z","title":"Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T12:22:13.551709Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.16335"},"observation_digest":"sha256:9a3f32362c95871e83ae10f02544202c821db5fbc2c9c1c7fd2e048dc4e23dfc","observation_id":"d4a371a1-8bf5-49fd-8ab3-d17134a5225b","resolution":{"observed_at":"2026-05-15T12:25:35.836993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.18027","last_updated":"2026-04-20T09:52:50Z","snapshot_observed_at":"2026-08-12T15:31:27.278597Z","submitted_at":"2026-04-20T09:52:50Z","title":"CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T04:59:44.880102Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.18027"},"observation_digest":"sha256:335e818f11c3c2b6105a3b2998f5ce365ac31962bb56a18533529c3b8ab9dbb4","observation_id":"5335f5e0-a2ef-4c60-aca3-0809b19ee7ab","resolution":{"observed_at":"2026-05-10T10:29:25.217935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.08468","last_updated":"2026-05-08T20:39:32Z","snapshot_observed_at":"2026-08-02T16:12:56.247576Z","submitted_at":"2026-05-08T20:39:32Z","title":"PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:12:37.970638Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.08468"},"observation_digest":"sha256:3008d8432c34a2edbf458a40a599dce17454808dabe3c11997f49f4a35d757dc","observation_id":"de5616c2-4498-479a-80ef-866762313403","resolution":{"observed_at":"2026-05-12T08:21:26.080342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.09134","last_updated":"2026-05-13T16:38:24Z","snapshot_observed_at":"2026-08-11T16:13:38.672124Z","submitted_at":"2026-05-09T19:31:02Z","title":"BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-12T03:09:40.321500Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.09134"},"observation_digest":"sha256:7f43c16342cb6e5cbd73e84b7b58a4638e28725b2a7a180e3b2fb6ee14a02b7f","observation_id":"1e6959cd-4a2f-4088-9d8f-8fa9aee28c31","resolution":{"observed_at":"2026-05-12T03:11:18.979788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.09134","last_updated":"2026-05-13T16:38:24Z","snapshot_observed_at":"2026-08-11T16:13:38.672124Z","submitted_at":"2026-05-09T19:31:02Z","title":"BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-13T06:03:32.270553Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.09134"},"observation_digest":"sha256:9af2eda96ea2a01412ae56234ae63eb725a17d8e9af12284e1299b38ca6e06c1","observation_id":"71e6a669-defc-4543-bd0c-571fbabf2cb5","resolution":{"observed_at":"2026-05-13T06:07:22.367744Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.14539","last_updated":"2026-05-14T08:22:21Z","snapshot_observed_at":"2026-08-11T10:22:55.411568Z","submitted_at":"2026-05-14T08:22:21Z","title":"Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T01:41:31.631505Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.14539"},"observation_digest":"sha256:68f9141532d748392418d8dcb0e7366724942f5c928f8da52453de44da7599b1","observation_id":"61dd3dc0-56a7-474c-93e4-1a540b0357bf","resolution":{"observed_at":"2026-05-15T01:43:27.601951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.17497","last_updated":"2026-05-17T15:14:24Z","snapshot_observed_at":"2026-08-15T19:35:05.302488Z","submitted_at":"2026-05-17T15:14:24Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-20T14:42:55.368104Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.17497"},"observation_digest":"sha256:61d49a879e2cac4cda07d9d032c135316463fbbae66853d51c2db08252458817","observation_id":"706ce023-1d4b-400f-9605-f8ed0fb8259a","resolution":{"observed_at":"2026-05-20T14:43:22.222344Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.17792","last_updated":"2026-05-18T03:17:38Z","snapshot_observed_at":"2026-08-16T03:15:24.735419Z","submitted_at":"2026-05-18T03:17:38Z","title":"HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-20T13:28:03.965754Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.17792"},"observation_digest":"sha256:0ddf1beb97cef7f2dcae22fe7c43db4ab5fed269de91421841dff3826e000815","observation_id":"cbbfb1d5-2ad0-4a09-851a-d943557595ac","resolution":{"observed_at":"2026-05-20T13:28:18.834772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.18747","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-08-16T00:13:58.777607Z","submitted_at":"2026-05-18T17:59:03Z","title":"Code as Agent Harness","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-20T10:54:54.558241Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.18747"},"observation_digest":"sha256:6c650b0c7b8570c907bb895cfff3ad02823d7c04427e2936a70643e4f38dca47","observation_id":"4b8c36f2-35bd-48e7-b0fe-ebdaa2ae94e0","resolution":{"observed_at":"2026-05-20T10:58:14.301565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.21235","last_updated":"2026-05-20T14:24:11Z","snapshot_observed_at":"2026-08-12T22:42:33.005869Z","submitted_at":"2026-05-20T14:24:11Z","title":"LamPO: A Lambda Style Policy Optimization for Reasoning Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T05:11:35.785227Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.21235"},"observation_digest":"sha256:d94b13854535691082f2cacc5005f37a3f4b2b0b95544775d9edcd6e92d96bc0","observation_id":"e60c5963-68fb-4953-90eb-5fc7254f05f9","resolution":{"observed_at":"2026-05-21T05:13:58.422663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.22675","last_updated":"2026-05-21T16:18:41Z","snapshot_observed_at":"2026-08-20T21:23:34.321743Z","submitted_at":"2026-05-21T16:18:41Z","title":"Self-Policy Distillation via Capability-Selective Subspace Projection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:42.803465Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.22675"},"observation_digest":"sha256:d363b6a8f9827340d522f01c54b583c98a8efa31a7a078f28157e15768127316","observation_id":"59c618b0-de54-4a45-99fb-e3b65c89d6f4","resolution":{"observed_at":"2026-05-22T05:34:40.386519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.28328","last_updated":"2026-05-27T11:28:38Z","snapshot_observed_at":"2026-08-12T22:24:44.263510Z","submitted_at":"2026-05-27T11:28:38Z","title":"Learning the Error Patterns of Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:56:04.187007Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.28328"},"observation_digest":"sha256:e1d5582b7d2eb59e6a030df165ad625a2ce0fb9022fa3e02bbbf12989c4b02e4","observation_id":"86301b5d-5ca7-45a6-93ff-f7022016e5a4","resolution":{"observed_at":"2026-06-29T14:03:29.670798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2606.03489","last_updated":"2026-06-02T11:07:20Z","snapshot_observed_at":"2026-08-14T16:25:53.570697Z","submitted_at":"2026-06-02T11:07:20Z","title":"Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T09:40:35.258818Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2606.03489"},"observation_digest":"sha256:777faa780b3f8747f7a5c300a04b5d7be76664d14014d546e679235a0270aae3","observation_id":"cf5dea75-95b2-4735-be05-ef2454e75c9d","resolution":{"observed_at":"2026-07-02T03:46:33.093345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-08-11T18:07:40.444367Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":298,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:bc0409b2aaa929b09cb8be14dd2aee22b286fb6e5a655a9118b400139e04a0ff","observation_id":"af5d5b50-2658-4b97-b35b-aa63b36d48df","resolution":{"observed_at":"2026-07-04T06:29:38.270687Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2606.28438","last_updated":"2026-06-26T07:35:43Z","snapshot_observed_at":"2026-08-03T00:04:55.169727Z","submitted_at":"2026-06-26T07:35:43Z","title":"When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs","version":1},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-06-30T01:29:42.919461Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2606.28438"},"observation_digest":"sha256:c78e3120b0a8313832f496ec640968b215769ef82a791ecbf70161436ebc9480","observation_id":"0db63301-0fce-4dd1-a679-b74a2b8679f3","resolution":{"observed_at":"2026-06-30T01:34:09.489245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:c0cb891cfde39df8f73e26ea2d4177efe01f020fb83e7d5e21ccb631945e1924","observation_id":"94718f18-42ee-4043-b317-adf8860d58f3","resolution":{"observed_at":"2026-07-03T16:38:39.791771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-11T17:00:48.664985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04577","last_updated":"2026-07-06T01:04:40Z","snapshot_observed_at":"2026-08-17T16:01:58.896061Z","submitted_at":"2026-07-06T01:04:40Z","title":"Beyond the Need for Speed: Energy-Aware Code Generation via Simulation-Guided Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T17:00:48.664985Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.04577"},"observation_digest":"sha256:2cc04de158bf4643ecb679a9d319c83c3c4ffa842b7dfc366f21c6be82755b8e","observation_id":"16ed8299-fb9d-4606-9c31-af71c070ade7","resolution":{"observed_at":"2026-07-11T17:00:48.664985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-14T22:36:10.404227Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:3287ad1f016c7e750549c9d49e2c322149d1f74b75d2c6aa32aeeab85b88c875","observation_id":"dfd47062-a949-4b64-969c-22bb38ce2cf8","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T13:39:15.458226Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-15T02:55:28.780267Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.458226Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:2fa2d67faafbdba5b9a4a85a2ed6b719fca06dd24eb33074dd6f55f6c907dc7f","observation_id":"ae5926b7-33cb-4f8d-93b0-fb5d51422def","resolution":{"observed_at":"2026-08-01T13:39:15.458226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T09:12:22.385849Z","title":"https://arxiv.org/abs/2410.02089v2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20862","last_updated":"2026-07-23T02:39:11Z","snapshot_observed_at":"2026-08-14T12:31:06.359463Z","submitted_at":"2026-07-23T02:39:11Z","title":"CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T09:12:22.385849Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.20862"},"observation_digest":"sha256:79f5425af51f9d3821a3a5c58ff55f118cc0f2c1d77b7801c45f3544eff28d26","observation_id":"873b42e5-cbfb-4569-9dae-a9a5bf5f35a1","resolution":{"observed_at":"2026-08-01T09:12:22.385849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-15T15:35:43.868636Z","title":"Gehring, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20908","last_updated":"2026-07-23T04:06:41Z","snapshot_observed_at":"2026-08-18T19:50:43.581405Z","submitted_at":"2026-07-23T04:06:41Z","title":"Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-15T15:35:43.868636Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.20908"},"observation_digest":"sha256:ce64bc40fb137c62e7f629d28d5fce0e3e54d1bd7816f47811e7b3ea7fbc9e6b","observation_id":"66add268-a6a3-4546-9455-f27ca8322428","resolution":{"observed_at":"2026-08-15T15:35:43.868636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T08:36:30.457193Z","title":"arXiv preprint arXiv:2410.02089 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21090","last_updated":"2026-07-23T09:20:38Z","snapshot_observed_at":"2026-08-17T18:15:25.156500Z","submitted_at":"2026-07-23T09:20:38Z","title":"Training Large Language Models for Self-Explanation Faithfulness","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:30.457193Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.21090"},"observation_digest":"sha256:1f3af83d86f677ebe43beaec88b06b2811f80d57ef0bad3abd12f620a53e0fa2","observation_id":"8597521d-8618-40b5-9d1a-cfa2c439d041","resolution":{"observed_at":"2026-08-01T08:36:30.457193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T04:28:45.552110Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22529","last_updated":"2026-07-24T17:59:22Z","snapshot_observed_at":"2026-08-19T01:34:25.763212Z","submitted_at":"2026-07-24T17:59:22Z","title":"Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T04:28:45.552110Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.22529"},"observation_digest":"sha256:96c621aaa09098f516fc26ec19f6a5b4b0254bb54663a865c0291ac944a73249","observation_id":"bba3d182-65cb-4f0c-a6a5-429435763b84","resolution":{"observed_at":"2026-08-01T04:28:45.552110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T10:53:08.880515Z","title":"Guo, D.; Yang, D.; Zhang, H.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27271","last_updated":"2026-07-29T11:39:55Z","snapshot_observed_at":"2026-08-19T12:05:26.237713Z","submitted_at":"2026-07-29T11:39:55Z","title":"RLPF: Reinforcement Learning from Performance Feedback for Code Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T10:53:08.880515Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.27271"},"observation_digest":"sha256:3eeadeeab02e5eb627a8fe9813de65e0f7fa27e9fd9692ba1403f7bffc62f6ea","observation_id":"9989336a-ed70-49c6-9097-e3ccdfc965fc","resolution":{"observed_at":"2026-08-01T10:53:08.880515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T00:14:38.260775Z","title":"Jonas Gehring, Kunhao Zheng, Jade Copet, Vegard Mella, Quentin Carbonneaux, Taco Cohen, and Gabriel Synnaeve","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01804","last_updated":"2026-08-04T02:24:08Z","snapshot_observed_at":"2026-08-12T13:08:26.566127Z","submitted_at":"2026-08-03T07:12:52Z","title":"LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:38.260775Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2608.01804"},"observation_digest":"sha256:6204f8705f02e5fca722a23c4ce668b4644aa1094ef08cd84e618127a9b8571e","observation_id":"4b0e5296-46c0-4996-9f78-40f3af77103c","resolution":{"observed_at":"2026-08-07T00:14:38.260775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-04T19:59:00.219331Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-19T11:40:46.347368Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.219331Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:a1a3b6cdc047add3d0ccf4ac0f24fbf428f6a5c0e4d6fa3a5db05595d93bd361","observation_id":"6b017c0d-f03d-4ccb-8932-104c8caa8a47","resolution":{"observed_at":"2026-08-04T19:59:00.219331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-15T14:44:40.247401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04439","last_updated":"2026-08-05T04:29:30Z","snapshot_observed_at":"2026-08-20T05:15:16.775859Z","submitted_at":"2026-08-05T04:29:30Z","title":"ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:44:40.247401Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2608.04439"},"observation_digest":"sha256:71446ec1020532a48c798921be115883df32e1c6e9cfea8d1347cc3799603905","observation_id":"de34f7b8-461e-4d9d-9e54-8a1d419f59c9","resolution":{"observed_at":"2026-08-15T14:44:40.247401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02089/citation-record","integrity":"/paper/2410.02089/integrity","json":"/paper/2410.02089/citation-record.json","paper":"/paper/2410.02089"},"outbound":[],"paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 59 inbound Pith citation observations for arXiv:2410.02089."}