{"as_of":"2026-08-15T10:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23bc376490674151cff7d414e95970edad02ecb2136c1576d8cd2deaaa5a28d8","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:00:53.226387Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07147/citation-record","integrity":"/paper/2608.07147/integrity","json":"/paper/2608.07147/citation-record.json","paper":"/paper/2608.07147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-10T14:00:52.706852Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.706852Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:dd5cb6ac73491ead761f24beacc387ee281721b519133e8c150a5f9c93c607ba","observation_id":"96dd344a-c9a8-4a6c-8fe7-66aa61c3c76e","resolution":{"observed_at":"2026-08-10T14:00:52.706852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.884470Z","title":"A general theo- retical paradigm to understand learning from hu- man preferences","venue":null,"work_id":"efbb7ff6-4b18-4146-8915-c4581ca8cc2f","year":null},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.715509Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:0221849fc19e6375f242b71c59679f3165f19a70f4fab93987635473c49eae83","observation_id":"b30ba429-aa4e-4f0c-a4a1-b7431964c91f","resolution":{"observed_at":"2026-08-10T14:00:54.891649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.862620Z","title":"A course in metric geometry, volume 33","venue":null,"work_id":"22dd1e62-0974-445c-b063-dd4a0f9e21d6","year":2001},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.722903Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:488e0ea953d37ba617f30fe2c37adde32f3a733f87cf32ba58773eebb319aa76","observation_id":"c0caab54-2410-4fa9-88d2-a451dd47fc33","resolution":{"observed_at":"2026-08-10T14:00:54.868084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-10T14:00:52.729442Z","title":"Minimax-m1: Scaling test- time compute efficiently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.729442Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:d889af5ca802090392cfaea396c11769e588fa9eb892d45fc12980cc01eb8234","observation_id":"eafb808e-3f7e-4071-88ff-7ec9de1adfa6","resolution":{"observed_at":"2026-08-10T14:00:52.729442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-10T14:00:52.742000Z","title":"Codet: Code generation with generated tests.arXiv preprint arXiv:2207.10397, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.742000Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:49bd8e8d62982ad9d69abd924c0a67ca406a43dbb427ddc70f7d1f4764d681d6","observation_id":"a2414384-1702-4a07-87fb-580d91a55674","resolution":{"observed_at":"2026-08-10T14:00:52.742000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-14T15:03:39.227865Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-10T14:00:52.751101Z","title":"Reinforcement learning for long-horizon interactive llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.751101Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:9939e8853dbed09aeb5eda375eb3810ec2783e12394152857df364cdffe28245","observation_id":"604af2c4-39c3-4a80-8fb9-b61d552f1bdd","resolution":{"observed_at":"2026-08-10T14:00:52.751101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T14:00:52.758668Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.758668Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:e49119905741d02e5f76a869498f1096e89c73e27b7668e307834a56d8dc4ad4","observation_id":"ee1b012a-c8f5-48a4-aed1-cd8f86d8ec9e","resolution":{"observed_at":"2026-08-10T14:00:52.758668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.839518Z","title":"Teaching large language models to self-debug","venue":null,"work_id":"7b10ac21-cc62-453d-b80c-4fba4e0d9dc7","year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.766615Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:8212d8f3218b6f74f745937c1635bebb79d004d5c2608220bdd781546406daa3","observation_id":"ded73128-d4c1-4245-9883-16835dc4b281","resolution":{"observed_at":"2026-08-10T14:00:54.849027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19413","last_updated":"2025-04-28T01:46:35Z","snapshot_observed_at":"2026-08-14T23:23:31.683130Z","submitted_at":"2025-04-28T01:46:35Z","title":"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19413","snapshot_observed_at":"2026-08-10T14:00:52.774989Z","title":"Mem0: Building production-ready ai agents with scalable long-term memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.774989Z"},"links":{"cited_paper":"/paper/2504.19413","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:4e2c4a452471ee9b489201f975a6c0f10391d1f5cb4fde6ee59ace75a483ff66","observation_id":"3e686dfd-e70d-4e72-aaf0-8c0b698f8046","resolution":{"observed_at":"2026-08-10T14:00:52.774989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.817524Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"f986f3f5-dbef-42b4-acce-7164ab2641a9","year":2017},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.780959Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:5195ee2222e7c484e2990d3ec1d856bd805d638f8a005cecf99d45ba9b4a779c","observation_id":"c318a7f3-178f-4734-a570-a17178156205","resolution":{"observed_at":"2026-08-10T14:00:54.824505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T14:00:52.788428Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.788428Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:853917bc843775f1a1c6701bca6a06177d9033388af6e544ff6c1ed768b9ce4e","observation_id":"a03c4c37-e90d-40b1-8b97-6a433e41c913","resolution":{"observed_at":"2026-08-10T14:00:52.788428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-10T14:00:52.797382Z","title":"Process rein- forcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.797382Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:8bb9743b2d94e3d8acf5c3fd772b2fa6f4fc9a9548696dcd0f950927495ccd19","observation_id":"52f58160-bd33-4651-bd7c-c33a04f1ecc4","resolution":{"observed_at":"2026-08-10T14:00:52.797382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.795642Z","title":"Memp: Exploring agent procedural memory","venue":null,"work_id":"0573e6dd-6f4e-415c-b990-1fc3835024d7","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.803557Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:bceded3e2321aa20f76bf6c81f7598c7cf6e870742d452bc91d0113aec03f85f","observation_id":"c0e354f9-bf1b-46bf-aa42-b7357d9270d6","resolution":{"observed_at":"2026-08-10T14:00:54.802083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.774524Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":"467990c7-bc48-48e6-aec7-acaa638cb508","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.810978Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:330e2522ba1bf5e4ac1e8573a39c7d6e0c42d3ff5f34485403ce2aa0f4d95c10","observation_id":"bb008a4b-e7ba-45fb-beae-70e58aea9c77","resolution":{"observed_at":"2026-08-10T14:00:54.781914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-08-13T02:34:38.117682Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05999","snapshot_observed_at":"2026-08-10T14:00:52.821269Z","title":"Incoder: A generative model for code infilling and synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.821269Z"},"links":{"cited_paper":"/paper/2204.05999","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:753db523dea34fcfd78742df819bf99671991cefbda940b0cfef26e2a935418c","observation_id":"8a10f563-8b5a-423c-bcb6-b2ca68db2106","resolution":{"observed_at":"2026-08-10T14:00:52.821269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T14:00:52.827996Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforce- ment learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.827996Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:74772ad7a4513ca173bc5864883c9835981c3432fc41fd59feb512c447186ef1","observation_id":"86773d89-d8d2-452f-b7bf-0ed4afeaf70c","resolution":{"observed_at":"2026-08-10T14:00:52.827996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-10T14:00:52.837073Z","title":"Skywork open reasoner 1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.837073Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:27588c5910f9e81bc0f6a6401f11097862fffc2983780bf426d4a2a6a4ab62bf","observation_id":"3b2aedc4-624e-4d1f-be0d-6ab78e6847fc","resolution":{"observed_at":"2026-08-10T14:00:52.837073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-10T14:00:52.844229Z","title":"Measuring coding challenge competence with apps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.844229Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:e1eca57d6d08474fe32d0992d0b2cf4a19eabf11c3773d97763f7b4a6b0bf0ef","observation_id":"97a60960-3f80-4c5f-bfe0-ab41e5cb9842","resolution":{"observed_at":"2026-08-10T14:00:52.844229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:52.852500Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.852500Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:8d460e346794e27bb492d7ee44b12e139541cedca237420c453b37e7d860fef5","observation_id":"34727b05-4c6b-43c7-a075-5848c0928136","resolution":{"observed_at":"2026-08-10T14:00:52.852500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-10T14:00:52.859229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.859229Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:476f9352b702beebb874ed0f8986ac7fd3c6841cbd240ad18e8bc6651d9c2387","observation_id":"715dce2b-b515-4371-ad60-dc1057a9ebc3","resolution":{"observed_at":"2026-08-10T14:00:52.859229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-10T14:00:52.868170Z","title":"Live- codebench: Holistic and contamination free eval- uation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.868170Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:6798f54608c8a893f618989a84b8af24548662a2e01a07f88a66d8933f4c410d","observation_id":"07eab6a8-4ab8-441a-8f55-1c5f7d143ec6","resolution":{"observed_at":"2026-08-10T14:00:52.868170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.738044Z","title":"Cure: Code-aware neural machine translation for auto- matic program repair","venue":null,"work_id":"4a2230a8-dca0-4d6d-9cda-4b4f7dc7ddd0","year":2021},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.874648Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:c6d74a33514ada4189669be7c7885fcc0bda8c474a4d85536e07c88ebb41a4fc","observation_id":"72af3f08-9c54-4441-821f-77df178fe084","resolution":{"observed_at":"2026-08-10T14:00:54.745463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.712337Z","title":"Self-planning code generation with large language models","venue":null,"work_id":"6f57dbd7-d81c-4d1c-9df2-6c23c2edea9d","year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.887948Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:9a847892bcdeb555a5e8af2564b09708ef00aecd4c894c09662729f30fe9d409","observation_id":"5d23cf88-c9c3-4622-8cf1-58faf4a36a0c","resolution":{"observed_at":"2026-08-10T14:00:54.719715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-08-02T15:24:09.026985Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-08-10T14:00:52.897000Z","title":"Coderl+: Improving code generation via reinforcement with execution semantics alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.897000Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:a34cfa21241018c8434fb927c72a6ea4ca83272f75388b283352fe013dcfd1d6","observation_id":"be636341-f7aa-4b45-a333-a47237e80770","resolution":{"observed_at":"2026-08-10T14:00:52.897000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.690532Z","title":"Swe-bench: Can language models re- solve real-world github issues? In International Conference on Learning Representations, volume 2024, pages 54107–54157, 2024","venue":null,"work_id":"6efff9f0-09ea-460c-901a-c4e9f88c5a17","year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.905481Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:c379dfc05e2b0b14354345a0944fcaae7ad16fcb3e620f5b7ed08bea0b2da8f2","observation_id":"c30cfec5-0f4d-4ac4-a2e8-f83ee8545226","resolution":{"observed_at":"2026-08-10T14:00:54.697644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.671002Z","title":"Defects4j: A database of existing faults to enable controlled testing studies for java programs","venue":null,"work_id":"09e03b11-f95d-4bd3-870a-3c7f8b6fb812","year":2014},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.917446Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:31f5931719d87c58fc863ac9e7e64b7ef15f54c43841b33dd306a648a182e512","observation_id":"1c03404b-347f-446e-9ace-e665d587bd5e","resolution":{"observed_at":"2026-08-10T14:00:54.677349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.649493Z","title":"Ds- 1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":"ae95d601-26ba-4044-8399-a92639bacc4c","year":2023},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.924876Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:679d1a641a2787f16318e53c1e077d6b58b9a7beef050ca2aefd486828041689","observation_id":"39751694-7240-46a2-aa05-80913ae7ff9c","resolution":{"observed_at":"2026-08-10T14:00:54.655863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.629469Z","title":"Coderl: Mastering code generation through pretrained mod- els and deep reinforcement learning","venue":null,"work_id":"5be5bd8f-441f-4a7a-8b6c-2f82b5060992","year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.935617Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:58058a5922c76a4095de49a3fde26cde5773f76af804b9eda18bed0031e7e160","observation_id":"c4df06f0-ca4c-4fbc-a9a2-8dc4f6508833","resolution":{"observed_at":"2026-08-10T14:00:54.635931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.607213Z","title":"A systematic study of automated program repair: Fixing 55 out of 105 bugs for $8 each","venue":null,"work_id":"7fcb6411-eaf0-461f-b3e4-81ab8507771e","year":2012},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.945542Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:b289fdb9d0c616665b277ffea47a26158428f48c0ebb4f48f0b6261e424af2b5","observation_id":"b7090b3d-68ee-4154-8aa9-abadb60c460f","resolution":{"observed_at":"2026-08-10T14:00:54.613194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-08-11T05:18:08.192130Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-10T14:00:52.951785Z","title":"Meta- harness: End-to-end optimization of model harnesses","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.951785Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:b37996fef8f54e809a7ce8accc342c3ef716150c569fa96d2b9251e29d4b0ed7","observation_id":"a4423c6f-381a-4223-ac9f-5611ff0c601e","resolution":{"observed_at":"2026-08-10T14:00:52.951785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-10T14:00:52.959772Z","title":"Starcoder: may the source be with you!arXiv preprint arXiv:2305.06161, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.959772Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:724a660dea44d398f0a2630d4fcdfeb39d66f5b0e4ed8c752542d589bf91961a","observation_id":"e42778f4-00d3-49f6-8d85-2a101745a892","resolution":{"observed_at":"2026-08-10T14:00:52.959772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.586615Z","title":"Let’s verify step by step","venue":null,"work_id":"c83029bc-27eb-4dc5-9f9f-e42b5381cb1f","year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.968533Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:7c694ec9345ba656f9205c539ef6cfd2217e95b99106ee3cb28b3c85886f098d","observation_id":"a2d316f3-4a1e-459c-a37a-b2ad8723f5ba","resolution":{"observed_at":"2026-08-10T14:00:54.592579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.566238Z","title":"Automatic patch gen- eration by learning correct code","venue":null,"work_id":"07174ea9-b708-42e5-b03e-700729f6174e","year":2016},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.976470Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:904dce834175f4ed2fce62ec93c6bb660e330647da700ed00445a833d4ef38e4","observation_id":"d98740db-f9be-47a6-a44b-9c8a68c49c18","resolution":{"observed_at":"2026-08-10T14:00:54.573032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08377","last_updated":"2026-08-10T11:40:00Z","snapshot_observed_at":"2026-08-13T23:38:44.225146Z","submitted_at":"2026-04-09T15:38:27Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08377","snapshot_observed_at":"2026-08-10T14:00:52.982894Z","title":"Skillclaw: Let skills evolve collectively with agentic evolver","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.982894Z"},"links":{"cited_paper":"/paper/2604.08377","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:144a185a82b2439f3e71386bddaa70731d72b7decfcbe375018f82b055185fd6","observation_id":"38cc9b54-22aa-4d9e-b27b-be5d3f894c4a","resolution":{"observed_at":"2026-08-10T14:00:52.982894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.547025Z","title":"Gromov–wasserstein distances and the metric approach to object matching","venue":null,"work_id":"894efd80-f851-4864-90ce-6a3d4e0c84a5","year":2011},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:52.993757Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:561b2a5eaa9d93cdb5c72f70936959b2170832be8e853d84c62250a16d7b89f2","observation_id":"d9e86fcb-867e-407f-ac33-e219f224351b","resolution":{"observed_at":"2026-08-10T14:00:54.553305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.522822Z","title":"An analysis of approxima- tions for maximizing submodular set functions—i","venue":null,"work_id":"f1642ffc-027b-4e14-877c-20b26fe90c4d","year":1978},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.000836Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:5a6223d45e06c6416a8b1e693698e70a27e60b37d2a1d49b04e6106e790bba35","observation_id":"ffec4f66-7adb-44dd-abd4-e37dd26e4222","resolution":{"observed_at":"2026-08-10T14:00:54.529276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T14:00:53.010831Z","title":"Training language models to follow in- structions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.010831Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:648e74e2adec11395e29a88efd5c51a8bc83f1213abf38b655c600b076ceabb1","observation_id":"c8e1f20b-cf6b-4a58-b9b5-88a3e13e7256","resolution":{"observed_at":"2026-08-10T14:00:53.010831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-10T14:00:53.018708Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.018708Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:c1070a6d5a245674e6a381ac70695ca502fb8fe7627271ab085875404f15e58f","observation_id":"59b2863d-88c9-43e5-8ba9-a930c36d89e1","resolution":{"observed_at":"2026-08-10T14:00:53.018708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T14:00:53.028899Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.028899Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:b6c7d84d5a27bae350e310e840776896a03bab327fe2ce1f76d9a1dd36a9380e","observation_id":"6e2f8ecb-b654-4df3-9321-66e6bf130d60","resolution":{"observed_at":"2026-08-10T14:00:53.028899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10952","last_updated":"2024-04-16T23:27:38Z","snapshot_observed_at":"2026-08-13T00:28:43.864218Z","submitted_at":"2024-04-16T23:27:38Z","title":"Can Language Models Solve Olympiad Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10952","snapshot_observed_at":"2026-08-10T14:00:53.037166Z","title":"Can language models solve olympiad programming? arXiv preprint arXiv:2404.10952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.037166Z"},"links":{"cited_paper":"/paper/2404.10952","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:badedf43e3337cd888f8e9bae27f6c01919c2f2789b5f051a55fcfb59740e43b","observation_id":"01e04f36-e2b7-454d-9f54-8ab530e9e8b7","resolution":{"observed_at":"2026-08-10T14:00:53.037166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:53.045807Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.045807Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:0966f54392c3c81c2d0a0acd115c7063a14dc6b1cabb9c6f198439d28fd7bdc3","observation_id":"34648ae4-8a93-47f0-aee9-adfb3921f37d","resolution":{"observed_at":"2026-08-10T14:00:53.045807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-10T14:00:53.055761Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.055761Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:785e6b7e825bfeca4a45e70c1a6ae1ed6564d87ed83f99e2f6ccfdbdcc7ed786","observation_id":"b4ee0b14-3de4-4172-b51c-9c847a547bbc","resolution":{"observed_at":"2026-08-10T14:00:53.055761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.488311Z","title":"Ex- ecverify: White-box rl with verifiable stepwise re- wards for code execution reasoning","venue":null,"work_id":"53ef7976-7052-458a-8ac7-da8163559fb2","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.064958Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:e747dd8c37439e0cebc49067f3d8c65078f33e635f2934eea984699209f25a84","observation_id":"221ec3e4-32fb-4fef-86d9-8561cf0a0d4e","resolution":{"observed_at":"2026-08-10T14:00:54.494879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.468405Z","title":"Ex- ecutable code actions elicit better llm agents","venue":null,"work_id":"ccc7bec9-4b3a-472b-91e7-5b2424357538","year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.072789Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:31ad4112bd512a4cb1c091cb94f7d2e13058124447d9efd5d0eb2efe1930de63","observation_id":"47c4081e-8bdc-4fff-bf26-1a51e6c534a5","resolution":{"observed_at":"2026-08-10T14:00:54.475860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.445177Z","title":"Open- hands: An open platform for ai software developers as generalist agents","venue":null,"work_id":"f9bc91d1-2a9a-45ea-a330-19de87660d21","year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.083659Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:992b610abf406bb1b3d2beec7b25f26f2dc3d8089ded0aef6c97d150992fe4b9","observation_id":"0901c2c9-f0e5-41af-add5-75d7ad709401","resolution":{"observed_at":"2026-08-10T14:00:54.451400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09183","last_updated":"2023-05-16T05:46:31Z","snapshot_observed_at":"2026-08-13T11:41:58.601246Z","submitted_at":"2023-05-16T05:46:31Z","title":"Lightweight Self-Knowledge Distillation with Multi-source Information Fusion","version":1},"cited_work":{"arxiv_id":"2305.09183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09183","snapshot_observed_at":"2026-08-10T14:00:53.616560Z","title":"Lightweight Self-Knowledge Distillation with Multi-source Information Fusion","venue":"cs.CV","work_id":"3bf194cf-a232-4fff-a237-d3b3d7b77a2d","year":2023},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.093830Z"},"links":{"cited_paper":"/paper/2305.09183","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:3150a8e1760776546f16a7add836e276f57910197b00b10e32b33093939b2207","observation_id":"588315d6-711c-47f0-a712-50ff196738c3","resolution":{"observed_at":"2026-08-10T14:00:53.632208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.423315Z","title":"Multi-label self knowledge distillation","venue":null,"work_id":"a4c7a023-3e49-469b-8971-b9661d0b4a36","year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.103235Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:376a26f0f18b4a5387c2e094481d3d67d195861d5654ee2ae92cb9fc767e23a5","observation_id":"e38ea274-93e9-4d8f-9c39-8e34500c770f","resolution":{"observed_at":"2026-08-10T14:00:54.429162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10917","last_updated":"2026-07-31T13:26:54Z","snapshot_observed_at":"2026-08-15T09:04:54.646741Z","submitted_at":"2026-06-09T14:28:07Z","title":"Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution","version":2},"cited_work":{"arxiv_id":"2606.10917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10917","snapshot_observed_at":"2026-08-10T14:00:53.575784Z","title":"Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution","venue":"cs.AI","work_id":"98ef0047-4eab-462e-9766-0162b6a33e50","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.117008Z"},"links":{"cited_paper":"/paper/2606.10917","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:e310b43ac2e4adc937de97af981669dcb3d30967bbc5f1e8db1034c8eb562d5a","observation_id":"8e70c78f-71f1-41ae-9751-2a01ef3524bd","resolution":{"observed_at":"2026-08-10T14:00:53.586243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:53.127123Z","title":"Ojbench: A competi- tion level code benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.127123Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:5725fadeb6980aefef3c2545d535281a4d94284df447004403fd6718e7e431b7","observation_id":"4d604580-d058-465c-a1bb-13163f739bdd","resolution":{"observed_at":"2026-08-10T14:00:53.127123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-10T14:00:53.133261Z","title":"Ra- gen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.133261Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:7775a4059e5aa97469d36ad0d6bb68c63f3d3361888e43bf258b96dd1aa51028","observation_id":"b43e4fac-d08d-4843-b78e-462087c6991e","resolution":{"observed_at":"2026-08-10T14:00:53.133261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.403123Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824– 24837, 2022","venue":null,"work_id":"28d198a5-73d9-4b70-a606-34c71a407d0e","year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.141550Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:1292f9f699e773d87ad0d26427ffaa5e1e32f7c6c5fb8a31a32e442cadcf6b86","observation_id":"ca742a1c-a1c6-4dee-81a6-3d791f4b3904","resolution":{"observed_at":"2026-08-10T14:00:54.408999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.380685Z","title":"Swe-rl: Advancing llm reasoning via reinforce- ment learning on open software evolution.Advances inNeuralInformationProcessing Systems, 38:78500– 78525, 2026","venue":null,"work_id":"f53b68b3-8c17-4808-9834-8da264fce35d","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.148353Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:28943048eede0a552661d72e569db75710b91406dab8cbda25ab807939116ead","observation_id":"3bbe2263-4e0c-4dc1-8f32-39249168a903","resolution":{"observed_at":"2026-08-10T14:00:54.387694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-08-10T19:28:41.964638Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-10T14:00:53.155623Z","title":"Agentless: Demystifying llm- based software engineering agents.arXiv preprint arXiv:2407.01489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.155623Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:7c50e6982f5092834252e87bb369992ee9b1d4d1a2040e817551c3b4264da04f","observation_id":"b5487387-c251-4b8f-a5bf-fcec858ac467","resolution":{"observed_at":"2026-08-10T14:00:53.155623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-08-14T19:36:01.674748Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-08-10T14:00:53.161982Z","title":"Leetcodedataset: A temporal dataset for robust eval- uation and efficient training of code llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.161982Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:8e0ad1528f94cc045de2f954812c2ee1b7523b2a3d16579729cae6698d15456f","observation_id":"3508a87c-76e5-4c2d-8369-6cd95c41bad6","resolution":{"observed_at":"2026-08-10T14:00:53.161982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.354691Z","title":"Icpc-eval: Probing the frontiers of llm reasoning with competitive pro- gramming contests.Advancesin Neural Information Processing Systems, 38, 2026","venue":null,"work_id":"bf9ff08b-7eda-4d5f-8b09-8fc878ab65f2","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.169064Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:53b7f483a4b33080e0629d8500b7a4c815dcc09104b9b2f76fb2b39da2c55e05","observation_id":"2f320710-abfb-4221-abeb-35ea8925fee4","resolution":{"observed_at":"2026-08-10T14:00:54.363007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.329760Z","title":"Swe-agent: Agent-computer inter- faces enable automated software engineering","venue":null,"work_id":"fed3fb52-bbe2-4678-add9-736591a5d951","year":2024},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.177569Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:02d2cc1728ec7aa1eab420dd7ff518573a737452240dafa72af3f3937015da19","observation_id":"fac97e41-cf4b-4f13-a262-43bc38f2b12b","resolution":{"observed_at":"2026-08-10T14:00:54.335861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.306361Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"eec19299-45a1-4d6b-9781-0f1cbe2e4438","year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.184920Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:b5da94ac139107e43917fa3c12c9d5e03f304fdcb956f26b3806320cd6a54db3","observation_id":"ea1ef2f3-8f9b-46eb-8f3d-373ca0326653","resolution":{"observed_at":"2026-08-10T14:00:54.314717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.284751Z","title":"React: Syn- ergizing reasoning and acting in language models","venue":null,"work_id":"be7e0d5a-f168-418f-a00e-c3882e89a866","year":2022},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.193005Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:65738d81d23c730d8a08e8ec48cde6e0c31fb0f60d2ec5e2a493493068372114","observation_id":"cfdc3d24-d520-4968-9b00-34595f0ed208","resolution":{"observed_at":"2026-08-10T14:00:54.290530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.265151Z","title":"Dapo: An open- source llm reinforcement learning system at scale","venue":null,"work_id":"9b36399f-32f3-4ddb-9dd0-91f0e5e1e962","year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.199443Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:83f8f2c1c961c7b9f3e2acc8cb6f471a7ce0e00882d974f298561ec516a8048e","observation_id":"50916849-3599-4b50-beee-4b8a7bb28f7a","resolution":{"observed_at":"2026-08-10T14:00:54.272093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-10T14:00:53.210565Z","title":"Group sequence pol- icy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.210565Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:09741876c3c6c21fd6c5849530f99dd2127f93c5ee369c914148f5f9fcec057b","observation_id":"1aeb31ca-10f6-442b-b360-d62a0cecf979","resolution":{"observed_at":"2026-08-10T14:00:53.210565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:00:54.241966Z","title":"A syntax-guided edit decoder for neural pro- gram repair","venue":null,"work_id":"d626ea0b-a383-4ec4-834c-b4cd4734c0e6","year":2021},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.218339Z"},"links":{"citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:689367cd3c19b0f45763cb5d980338adbcc7657472ed278dcb11faf247110ae0","observation_id":"1f4b7440-a570-47d8-b43f-e20b6eeeca5a","resolution":{"observed_at":"2026-08-10T14:00:54.249562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13217","last_updated":"2026-05-13T09:10:03Z","snapshot_observed_at":"2026-08-12T18:00:47.796022Z","submitted_at":"2026-05-13T09:10:03Z","title":"GAGPO: Generalized Advantage Grouped Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13217","snapshot_observed_at":"2026-08-10T14:00:53.226387Z","title":"Reported subsets","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:53.226387Z"},"links":{"cited_paper":"/paper/2605.13217","citing_paper":"/paper/2608.07147"},"observation_digest":"sha256:76104e2907a5b0395ed67a76d68790d102b31ddaf4ca98d4013514da17ca19ed","observation_id":"5d6bbe64-8f09-4f69-80c5-bd33ead92af8","resolution":{"observed_at":"2026-08-10T14:00:53.226387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07147","last_updated":"2026-08-07T12:07:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T02:43:35.087716Z","submitted_at":"2026-08-07T12:07:12Z","title":"DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2608.07147."}