{"as_of":"2026-08-14T11:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd2716f61185a38c709efe84c018bf777a0a2869a0acb9570192d3e1d16dbce8","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T23:13:43.754235Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:54:52.398402Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:54:53.394757Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07833","snapshot_observed_at":"2026-07-31T06:48:41.262444Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-05T23:11:20.921742Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.262444Z"},"links":{"cited_paper":"/paper/2511.07833","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:8e662ed387185997dc5837d15fabbe3c877d2a1d55087c476c88fe7bd05f96e0","observation_id":"7307b0b4-e442-4238-bc34-fa070b144c78","resolution":{"observed_at":"2026-07-31T06:48:41.262444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"cited_work":{"arxiv_id":"2511.07833","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07833","snapshot_observed_at":"2026-08-05T00:54:53.394757Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","venue":"cs.LG","work_id":"11479149-88c2-4285-9bd2-40d3237e7e8d","year":2025},"citing_paper":{"arxiv_id":"2608.00494","last_updated":"2026-08-01T07:35:06Z","snapshot_observed_at":"2026-08-14T06:40:11.467336Z","submitted_at":"2026-08-01T07:35:06Z","title":"TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T00:54:52.398402Z"},"links":{"cited_paper":"/paper/2511.07833","citing_paper":"/paper/2608.00494"},"observation_digest":"sha256:ffa5a47daddd0b4ea2807be6190d5c2a92ee0933326998dbc4b78e31c70f13d7","observation_id":"5a218909-b531-48f3-9c29-d41cf980f411","resolution":{"observed_at":"2026-08-05T00:54:53.401490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.07833/citation-record","integrity":"/paper/2511.07833/integrity","json":"/paper/2511.07833/citation-record.json","paper":"/paper/2511.07833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.938856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"38c07273-5071-4bbb-b2af-067af11becc7","year":null},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:863e8ad1687bfb532a164ca8f00d72f759016f0ed2f6d718500818bd30471d73","observation_id":"78f8feb9-63a0-4407-aab6-7a9673cbd448","resolution":{"observed_at":"2026-05-17T23:15:27.077451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:404096c2ea4f8d225b15df6a1451b5d2d57ace0240c0a80df03841f709cac801","observation_id":"0dda1b3c-ec3d-453f-862e-506693063364","resolution":{"observed_at":"2026-05-17T23:15:27.073870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.662","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"e20a5ef6-abd6-4cf6-a8dc-2ffe3cf72c70","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:49b4462cd5e6aebcbd191569a1969d99acf3bb2349cb99fa1c0c815b3b2f734b","observation_id":"b8fbbeec-10c0-443b-948c-61f774d9dc34","resolution":{"observed_at":"2026-05-17T23:15:26.628592Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"46593534-f267-4420-b167-52cea881cfea","year":2002},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:5c10d3d1e6f56abb81ca34796c69d9b196c238e5c772a3f0b20fac3c4463810b","observation_id":"9af2921c-36e5-4d64-b5b9-26c3390a575c","resolution":{"observed_at":"2026-05-17T23:15:27.100254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:175569ad880f720ed1a8104b03af538027dc2b122e62965c1176b20bddfa16b7","observation_id":"ff021806-6cbc-4c4e-9f76-2040cafb1f6d","resolution":{"observed_at":"2026-05-17T23:15:26.709803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:a9d085060e7c3cef54c7cef258582e4215523ad7067673868c74d929e7ea2720","observation_id":"1732b6aa-d882-4e1a-82a8-01be7729ace3","resolution":{"observed_at":"2026-05-17T23:15:26.704346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-10T03:47:52.773511Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2503.19470","doi":"10.48550/arxiv.2503.19470","metadata_source":"pith","pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"cc9775d9-2fbd-4690-a641-2b50ae4a59dc","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:c523602a5f842bc7373da0bbb1409c108d34d5563843422612d942a5a8395be3","observation_id":"f88ba77c-3ad0-423d-b2a4-0c85c4a8f729","resolution":{"observed_at":"2026-05-17T23:15:26.720782Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:5a27ae05a47559dc24ace9daf58e34ad3847c620a926915d49a1cac981cd5ed4","observation_id":"b1eda87f-922b-4c70-8774-9d6a501c5b47","resolution":{"observed_at":"2026-05-17T23:15:26.687761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad41d315-16d4-4923-b91b-5cb94cc9b7ab","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:308cfc60ea50ffb4ac81a7179dca4ddfe1282d7a6bc7c95b663cb0c1964cd4eb","observation_id":"65231ea9-88c8-4882-99e6-313aa18a55cb","resolution":{"observed_at":"2026-05-17T23:15:27.109445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9f1e40e-582f-4a59-ae2b-df8fe5ab9678","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:aab9d0096c75aa0f1c81dc918129bbddb053069cf90c6c5cfb6cf5993964b149","observation_id":"4722bb41-a52e-45c6-8b49-523a937285b8","resolution":{"observed_at":"2026-05-17T23:15:27.106174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3747588","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:17:49.983772Z","title":"A survey on large language models for code generation.ACM Transactions on Software Engineering and Methodology, 35 (2):1–72","venue":"ACM Transactions on Software Engineering and Methodology","work_id":"2362b076-10d0-4e85-8b67-08ac034b2069","year":2026},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:3721c47ce99cf69177ca255a4603ae52bdcf31799194f49a6e98acb8b8752ae3","observation_id":"f1abe81b-2b82-4b9a-b184-5cf7b69e997e","resolution":{"observed_at":"2026-05-17T23:15:26.622996Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:07.785285+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:07.785285+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a254fd6-d775-4f65-8165-dbe3cd601b05","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:52939789ef6307b54e4392e8c0535200c876780af96668f2da265b70a1857cd9","observation_id":"8b8e813d-2af0-465f-8e07-a0f2d67932be","resolution":{"observed_at":"2026-05-17T23:15:27.067389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:3116817b1632eacdcd3717a7f709b0829863921f5c593a9182bf54ff892e5157","observation_id":"df5a381d-ad51-42b3-9a13-c7d69b8bf89b","resolution":{"observed_at":"2026-05-17T23:15:26.729709Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4fa19b49-3ad0-435c-b26b-d5d020260785","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:2fbb599b3706bf1b8446b40840de9c8417d87b4750b0c0e0aba499d7a6d81c6f","observation_id":"8ad6cdf3-0ee1-4abf-895f-66c145ce1fe6","resolution":{"observed_at":"2026-05-17T23:15:27.070238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"916ff575-be6b-4d01-9c33-071f353fa43e","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:a63b87a43a570e2fe8f0911c8f83883dd0879d2d5db0f1a7fc1c508f243ae387","observation_id":"f130e6de-927b-40dc-a66f-41c6705c35da","resolution":{"observed_at":"2026-05-17T23:15:27.064608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:9ffcd518121ec9793ca9f8d8287c3133d9dd1e836fb0be1c77edb36478fc7e8b","observation_id":"d253d772-7e72-419a-be9a-2a5655fdfa45","resolution":{"observed_at":"2026-05-17T23:15:26.681922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:41516a508ff00ae5ff04b84dcac1da60e9f9f0ebc1acecbf97904b691e767712","observation_id":"74db933c-5edc-4773-95cc-5a5dea52f840","resolution":{"observed_at":"2026-05-17T23:15:26.739295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:fb746810993d6ceff8cb8201b9597ac426abebbf41cbe2293126e5dea5ce7a64","observation_id":"0128674f-5ac9-4ba2-b120-789082f92ea8","resolution":{"observed_at":"2026-05-17T23:15:26.715339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:4d74139956af4c791da2a535a82e6f711a34f29cb2baf2fe3790c47957c74076","observation_id":"49832b57-ef4f-4347-9ac6-c76e8f00b508","resolution":{"observed_at":"2026-05-17T23:15:26.768199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"20ea8d01-8a30-41af-b695-ac1bd3820373","year":2023},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:6d2315c011359fff0b494020eafae67edfc6ffe9349ef4774d806b3355d0e985","observation_id":"587966da-50c4-4cc3-83bd-94e80bf9dd04","resolution":{"observed_at":"2026-05-17T23:15:27.097267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:befdee8d547bc169c544d5018f2fafd90bc20f53fad26ea9dfbb92f06fcd6a33","observation_id":"e32b2ea2-1a58-457f-979f-3b3d0eeae31a","resolution":{"observed_at":"2026-05-17T23:15:26.675857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c26fc0f-bc1f-4399-aa36-3a9ef342bfdb","year":2020},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:fe906d7b2d9ddc20b6d1974bd206f2768193e056bf9ab33e671abc8fdc6cb522","observation_id":"088eedf2-c4f2-4838-b9e4-7ee7292faf8c","resolution":{"observed_at":"2026-05-17T23:15:27.103118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3715754","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T05:05:24.532405Z","title":"Demystifying llm-based software engineering agents","venue":"Proceedings of the ACM on Software Engineering","work_id":"9e44bc74-5546-4f95-97d1-21b28bbb74cd","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:43bcedb5025576667897146e64cae0973f68fbd7d7f591da3a578365715b4254","observation_id":"b5332958-03b3-4694-8bc9-a08f8aa574a7","resolution":{"observed_at":"2026-05-17T23:15:26.616947Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.444454+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.444454+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2504.13818","doi":"10.48550/arxiv.2504.13818","metadata_source":"pith","pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","venue":"cs.LG","work_id":"e6d53e5b-2180-482b-82ca-0e64d572c87f","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:50667a65141580711f46fbf42175ead642d2d814fdaebf8542ebcf6b365b63c4","observation_id":"37f2ec39-82a2-48c0-a334-6b26acdf5d34","resolution":{"observed_at":"2026-05-17T23:15:26.698984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-12T22:20:05.529923Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":"2503.02951","doi":"10.48550/arxiv.2503.02951","metadata_source":"pith","pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KodCode: A di- verse, challenging, and verifiable synthetic dataset for coding.arXiv preprint","venue":"cs.LG","work_id":"7a8a1722-94c4-4a65-9391-3ffde48c168a","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:f53f08c88b6a27c628c0ebf0d28d7ee3d6ba192865dd69651397c22081f7fbf7","observation_id":"3c6e2350-a71e-4b38-b8a7-d1f6d650143f","resolution":{"observed_at":"2026-05-17T23:15:26.757913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:f85f7ff1b327afe6f55b972c9c5416e306d1c54483c430f54942f5c460ce5162","observation_id":"7d664539-6eb5-49a5-888c-b6feb604fda2","resolution":{"observed_at":"2026-05-17T23:15:26.693481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c37170be-eeb6-4a28-9635-e5833eb50df7","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:7d194e8bb0684b7f52b972d5f1ee9d9996d4e7d59b10c66efa835b21a8b3bc50","observation_id":"07f74694-db5e-4fad-a0f2-5248e4aac6fd","resolution":{"observed_at":"2026-05-17T23:15:27.089038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"562d996d-e91e-4668-8b37-4cb03a389ba9","year":2023},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:bdaaddeb9548d3597797cdb853c3858d100148229876e3fe1b019490bc36d80b","observation_id":"22249bd6-35ac-4837-870e-f8c1fba5d130","resolution":{"observed_at":"2026-05-17T23:15:27.091879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:ce63fba7e2c449eb88e13eab9c28b9c9bddec89bb0423d145ff769bf004854d4","observation_id":"1831d8ae-812e-4df3-a114-7d67837e9418","resolution":{"observed_at":"2026-05-17T23:15:26.725203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T17:33:49.286933Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":"2503.01491","doi":"10.48550/arxiv.2503.01491","metadata_source":"pith","pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":"cs.LG","work_id":"b9f345a1-11ca-4214-b731-220afdbef297","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:a6984df40a592694804d2804f9f8809feb6316d038e516185e422d6031c048e0","observation_id":"04809f1f-fea8-4b58-a2c3-8888db5b6d5a","resolution":{"observed_at":"2026-05-17T23:15:26.747000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:7a5c174ae5fe26895ae049c7bad4ab1f8bedf8e5953a70d532d0363e528d0409","observation_id":"99842e8b-521f-4a83-b48a-a42e6b4d92f8","resolution":{"observed_at":"2026-05-17T23:15:26.734331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-14T11:42:27.432711Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:51fbea135ec6b89dae6c6e8944da2f16e24b9c6a757a0931fdac7ed96b449e26","observation_id":"bb5db8fd-4415-4d2c-bb58-9cc652e33de5","resolution":{"observed_at":"2026-05-17T23:15:26.752887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:0020f13ec41f83c7752d6e9b9c2a1f9d2704e7fe9c0207f2ac6bd80ceb0188d0","observation_id":"7f5e4ec9-72af-4c30-bd9b-54387848f990","resolution":{"observed_at":"2026-05-17T23:15:26.763421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ed134bd2-e893-4dd9-a657-2272d3a42083","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:2948f17eb6c5fa5ecbec9146e24a561b0c66a3de48940aa8a7394806fbf8b842","observation_id":"bce6996a-dd7c-4530-8e04-81d35c727c3e","resolution":{"observed_at":"2026-05-17T23:15:27.086126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2fc61356-a695-4e33-94f0-9b0e939e7ec5","year":2024},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:8671c79ec927c0fb4fb94bc0155f33af9d79dd4395d8289fc73f1ef4f2baad20","observation_id":"a5897ef3-213c-4350-8834-62f414bfaa3b","resolution":{"observed_at":"2026-05-17T23:15:27.080401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a565e31-c9c0-4be6-8f14-7a2f66f54a4f","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:7a83a357daeb225fe824fb269a3f2639e86399745d87cc8a1ed0db26c2a068bc","observation_id":"e9b48f81-5e85-4f64-8170-38d6f713ba79","resolution":{"observed_at":"2026-05-17T23:15:27.094592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a34b3bd-40c4-4373-af72-8cf0081794ab","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:5f5c2dfadccc1e8d0172d584bf656775371e1d9d38538622e41664658f741816","observation_id":"e0f11304-120d-49c9-ba97-261317bcfb35","resolution":{"observed_at":"2026-05-17T23:15:27.083288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":14,"verified_exact":19,"verified_fuzzy":2},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2511.07833."}