{"as_of":"2026-08-18T22:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:436c5193e8b46aedc2238c989265d5a32fc5edf5e67126d4749c7146f659161f","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:31:54.358241Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:14:04.101113Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T17:26:04.783434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02211","snapshot_observed_at":"2026-08-02T20:14:04.101113Z","title":"Improving llm-generated code quality with grpo.arXiv preprint arXiv:2506.02211, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-13T22:48:49.325123Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.101113Z"},"links":{"cited_paper":"/paper/2506.02211","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:a1772be67a17b9c22bad0a460885b20c55f9816b4b9fa4b3003266bbcd1d8310","observation_id":"c4a76982-bab2-4716-b3a1-911f1a06ad74","resolution":{"observed_at":"2026-08-02T20:14:04.101113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"cited_work":{"arxiv_id":"2506.02211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"579f5d4c-5ed6-45b2-b72a-4861436b81d3","year":2025},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2506.02211","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:277b426330b6dfda1f594349f7b0244561ecff57ea99fa1cc58152711ac12adb","observation_id":"053b9dab-34da-4aa9-834e-b03b938dc901","resolution":{"observed_at":"2026-05-11T17:26:04.786091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02211/citation-record","integrity":"/paper/2506.02211/integrity","json":"/paper/2506.02211/citation-record.json","paper":"/paper/2506.02211"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T11:31:53.092772Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.092772Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:f64ca3f7d0ff450fcd0b2fa198e04f29cad2a1083ebe398bc7782c122bf8e538","observation_id":"e7d8571f-bed6-4320-94eb-c67e61bc8125","resolution":{"observed_at":"2026-08-07T11:31:53.092772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T11:31:53.249493Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.249493Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:ae5f9525673207f89f0903f1d79005395ab68c699a3fca01d6b9cfb3c82ebeb7","observation_id":"27ef6c89-a7dc-41ec-84a4-cefc545ee0fd","resolution":{"observed_at":"2026-08-07T11:31:53.249493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T11:31:53.421299Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.421299Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:6fe8811690bfdcc88af2b149bab676d722dab358a46abd1026d41d64d98b8e72","observation_id":"42e8fd50-6085-47b2-9879-b8b77ad352ed","resolution":{"observed_at":"2026-08-07T11:31:53.421299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T11:31:53.700853Z","title":"Python Code Quality Authority","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.700853Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:80f5c525159f35f4ad7e281b2edf9881add3eeb94606d59e16a8f6542597244e","observation_id":"e9bfec68-2cfd-40d0-a16a-60fa32f7e1e5","resolution":{"observed_at":"2026-08-07T11:31:53.700853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:31:53.801015Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.801015Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:4a0804379fc318da833eeb4b0150236106b149811ab22739d9276ff83fa951b8","observation_id":"4e323f52-8cda-464e-850c-c18facdd882c","resolution":{"observed_at":"2026-08-07T11:31:53.801015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:31:53.979789Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Y Wu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.979789Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:96ed575b9f9073a80b313829638cb86a49f513f04ee52f0ff38a15ada51563ce","observation_id":"db786141-1b76-41c9-9c68-35409a456dcc","resolution":{"observed_at":"2026-08-07T11:31:53.979789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-17T20:24:27.623104Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-07T11:31:54.286136Z","title":"PRLCoder: Leveraging Process-Supervised Reinforcement Learning to Enhance Code Generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.286136Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:78962dcdb9f3b792fcc870b895d2858fec385164ca4333e7e768b5ba131b9a2e","observation_id":"18e4674b-e365-46e7-8ec7-e59fadbb27af","resolution":{"observed_at":"2026-08-07T11:31:54.286136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:31:54.358241Z","title":"operation_audit.log","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.358241Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:7f3982932e066f53b7398922e41cb1113c1ceed6ffa7db6a3d0c6691f235aaa1","observation_id":"378849d3-2eeb-4410-9d09-7f42e5337343","resolution":{"observed_at":"2026-08-07T11:31:54.358241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T11:31:53.495008Z","title":"Measuring coding challenge competence with APPS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":1977,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.495008Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:f66de222df03abb14c24ba95accfe993d0c6ac2e5c34372fc10ee980d67bdbd7","observation_id":"16b8eb3b-5ed2-474b-9cc0-dc6b5efd9bd6","resolution":{"observed_at":"2026-08-07T11:31:53.495008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-16T16:48:21.526954Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-07T11:31:53.592291Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.592291Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:3fc8e05027e27935f5d0cfc277219abce0669184b4a027ec45fa9a117e6831db","observation_id":"f03c37c0-91bf-4042-876b-76f091be84d8","resolution":{"observed_at":"2026-08-07T11:31:53.592291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:31:53.908094Z","title":"Jendrik Seipp et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.908094Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:8956d33bb14e82c3fd3a588125f378e82ce9131c351b142c763e00d51631e50d","observation_id":"6ca98cb9-9959-472b-be3d-e676d2059e9d","resolution":{"observed_at":"2026-08-07T11:31:53.908094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09643","last_updated":"2025-04-13T16:34:17Z","snapshot_observed_at":"2026-08-16T12:41:36.034142Z","submitted_at":"2025-04-13T16:34:17Z","title":"Iterative Self-Training for Code Generation via Reinforced Re-Ranking","version":1},"cited_work":{"arxiv_id":"2504.09643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09643","snapshot_observed_at":"2026-08-07T11:31:54.540885Z","title":"Iterative Self-Training for Code Generation via Reinforced Re-Ranking","venue":"cs.CL","work_id":"cc1c5d56-b6bb-4a40-8ca5-8809616bcf66","year":2025},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.067709Z"},"links":{"cited_paper":"/paper/2504.09643","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:64c2b76c633f8d15e83742059b27e687ed828c58ce326119a308930851e3d5f9","observation_id":"7aa5ae01-ac28-44cb-aa26-bbf9606695d6","resolution":{"observed_at":"2026-08-07T11:31:54.623757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:31:54.201555Z","title":"The Mypy Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.201555Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:ade88fd446891fa431a0ecf21a1d37bbbc94b0d903d3a0b06750630ba5cc49f8","observation_id":"6bbf3403-b156-47ef-9a44-b9cca6cd9fd6","resolution":{"observed_at":"2026-08-07T11:31:54.201555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17621","last_updated":"2025-02-04T09:24:30Z","snapshot_observed_at":"2026-08-16T13:06:44.673900Z","submitted_at":"2024-10-23T07:22:33Z","title":"Process Supervision-Guided Policy Optimization for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17621","snapshot_observed_at":"2026-08-07T11:31:53.155905Z","title":"Ning Dai, Zheng Wu, Renjie Zheng, Ziyun Wei, Wenlei Shi, Xing Jin, Guanlin Liu, Chen Dun, Liang Huang, and Lin Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.155905Z"},"links":{"cited_paper":"/paper/2410.17621","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:f640ac1574a57804a5a27ebd72bbd67710e4876651c570e949a19dfb24345d95","observation_id":"70f3149e-36fb-4255-b48f-bdcf2e5f911e","resolution":{"observed_at":"2026-08-07T11:31:53.155905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:2506.02211."}