{"as_of":"2026-08-19T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c931475d233c23e7579e12f8ea21fb22bc12de2805fdb4b43cf7de38012a92a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T11:15:06.569421Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07435/citation-record","integrity":"/paper/2607.07435/integrity","json":"/paper/2607.07435/citation-record.json","paper":"/paper/2607.07435"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.30451","last_updated":"2026-05-28T18:20:32Z","snapshot_observed_at":"2026-08-12T12:15:34.611388Z","submitted_at":"2026-05-28T18:20:32Z","title":"VeriGate: Verifier-Gated Step-Level Supervision for GRPO","version":1},"cited_work":{"arxiv_id":"2605.30451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30451","snapshot_observed_at":"2026-07-09T11:16:11.347055Z","title":"VeriGate: Verifier-Gated Step-Level Supervision for GRPO","venue":"cs.LG","work_id":"6c22a130-50ff-455c-ad61-482760e383b3","year":2026},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2605.30451","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:bf7e85c1a01564acdfbf76217eba0ee25e1621b8ba13df3a09135bfff008e5e1","observation_id":"bae96de6-442c-45a9-9929-c2d07073cf79","resolution":{"observed_at":"2026-07-09T11:16:11.348368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:7124e420167227f31ecfe1abdbbf292987cedc83d3ce565d15c9d5be13026805","observation_id":"8127ab77-f987-4b2f-96ae-af671848b9ac","resolution":{"observed_at":"2026-07-09T11:16:11.338929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:13.900899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:13.900899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:8ce6e61e467edd10e626a2efa25ccbd8ecdd3ff07745cf4748e1f0466d51a06f","observation_id":"dec4b046-10b2-4450-98e7-4610de46580d","resolution":{"observed_at":"2026-07-09T11:16:11.370402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.372569Z","title":"Stop summation: Min-form credit assignment is all process reward model needs for reasoning","venue":null,"work_id":"cf984318-b245-4e96-8c6c-cd71baa448db","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:8ddf0875e34b497ac44d8a7e905c52e44c0b7b2f1f01c67d6336656b81b175eb","observation_id":"277e9b28-042c-4fb3-bd60-d5bc20a1880a","resolution":{"observed_at":"2026-07-09T11:16:11.374420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:9722f7715f350208d3f3d86b51fc2dc01926128ac5e46d7611eeb1f6e2559f50","observation_id":"23faed5f-88eb-4f72-ac68-f495bf80106c","resolution":{"observed_at":"2026-07-09T11:16:11.385558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:1dac1cc400da7895f1dac3627558a1bc15bba7432c7029b494e0c73076dbe006","observation_id":"394678d5-61c0-451d-8924-8e7731e4d3e1","resolution":{"observed_at":"2026-07-09T11:16:11.375765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.346092Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to repro- ducibility.arXiv preprint arXiv:2504.07086","venue":null,"work_id":"293ecb4d-96d1-4ced-a46c-a3aa4e23d934","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:041fccb32679ae616e198f3c4100cc926afb900edbad76280d4dae0dd3837b29","observation_id":"63e6b46b-70b4-4566-8f46-41b62353644a","resolution":{"observed_at":"2026-07-09T11:16:11.347992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.514381Z","title":"Carlos E Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":"3905ebcb-d699-429a-882b-e229a4544d25","year":2026},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:e8c0f9ba99765b30e4efe6fa488af8cc8e459848c8da82882143ba7799e5a28c","observation_id":"197a620a-923f-4a98-a041-77e89dc92f05","resolution":{"observed_at":"2026-07-09T11:16:11.516544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-16T16:55:23.982163Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:a9f5f805e6878b46f677db1a2124897958abd432ea441e986c1d10d0d6e9fd29","observation_id":"cb0895ee-fa12-415a-95cf-58c0b8c7ecdc","resolution":{"observed_at":"2026-07-09T11:16:11.298001Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:736f30d18b474b9ad5c7e2a4921c3abab0d45556a9faa986e7c34237784704a6","observation_id":"f943a7d1-3918-4d6f-a52e-8422a5d57d79","resolution":{"observed_at":"2026-07-09T11:16:11.378129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.375548Z","title":"V., Jeon, M., Vu, K., Lai, V., and Yang, E","venue":null,"work_id":"5c14151a-db91-479a-8213-0cfd1db9aca2","year":2026},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:a1980807628154719114323bfe13e71ab8692d81d7fc59bc23c2b5f654802334","observation_id":"353c53fe-8fb3-4a4e-ad63-ec7f4ebd72be","resolution":{"observed_at":"2026-07-09T11:16:11.377458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":"2309.00267","doi":"10.48550/arxiv.2309.00267","metadata_source":"pith","pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","venue":"cs.CL","work_id":"81d8781d-2933-4e89-97ee-9bbfc6d4ca0c","year":2023},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:78eb471ab0c6cab8c2117fca55653b71812f7ad2f0b96da4f43cc681d157c880","observation_id":"931625b7-2dc1-4c9e-9341-909ba77a86c8","resolution":{"observed_at":"2026-07-09T11:16:11.382159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-08-14T13:01:22.446912Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"cited_work":{"arxiv_id":"2508.19598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.19598","snapshot_observed_at":"2026-07-09T11:16:11.340947Z","title":"Encouraging good processes without the need for good answers: Reinforcement learning for llm agent planning","venue":"cs.LG","work_id":"9d394028-e798-472d-8802-1ff36b428157","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2508.19598","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:4170d3e4a0de3751b9be97943fa96e71fbf21ffa61b55cdd77759f8492e8d49c","observation_id":"423506aa-75f6-42fd-9526-0049c53259f3","resolution":{"observed_at":"2026-07-09T11:16:11.342496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19199","doi":"10.48550/arxiv.2509.19199","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic reinforcement learning with implicit step rewards","venue":"ArXiv.org","work_id":"6eb5e259-3013-4695-8aa8-ec5df9a9d481","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:1b52bb9b7c578da9769ea6720001ee80c4ee0a46e67d0106a0c9819bed836b29","observation_id":"f2614bf8-64dd-4a0d-bceb-15ae005edd3d","resolution":{"observed_at":"2026-07-09T11:16:11.364593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.383492Z","title":"Ngrpo: Negative-enhanced group relative policy optimization","venue":null,"work_id":"7cb63f10-8256-482c-8454-eebe075b7bfe","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:039ec52be272850bed4a048af17e61ed72f3689907de670c35007851b1927e14","observation_id":"75200a37-0b2d-4dd6-9cd9-18eb17d7ee96","resolution":{"observed_at":"2026-07-09T11:16:11.385216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:f222962101a8e3f182f26425fd0c3a661d54cd1d05dc8971faaee8d66d23da34","observation_id":"d992098a-e9c6-4fb6-a389-bac3dbbb4b13","resolution":{"observed_at":"2026-07-09T11:16:11.383178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:c622f9948c5db2865438f13929d143f30e632413053e988d6fda0c34091e639d","observation_id":"520d274b-f92c-4b51-a10f-b89807016227","resolution":{"observed_at":"2026-07-09T11:16:11.379832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:9391ab5b419208ca42d0d393cc0c67bd1853f4a6254f598641cb87214a380c03","observation_id":"b1aff8df-40b0-4f09-9a91-27824b376e08","resolution":{"observed_at":"2026-07-09T11:16:11.390498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.302873Z","title":"InThe Thirty-ninth Annual Conference on Neural Information Process- ing Systems","venue":null,"work_id":"30679b6f-ceed-47ea-bf15-78be35247157","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:7fe7b8a113f59079a5b2234ab0e0b696ee820f0f07c39af995a822704d85b530","observation_id":"4e287174-7fa2-40a7-b574-76043c248d4e","resolution":{"observed_at":"2026-07-09T11:16:11.304849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:8c22301653a7a9946bf72d9add0f94714e5c1364093a7f46263e24842d27dcae","observation_id":"10e0078b-dea0-4119-b6ce-119e875d93c1","resolution":{"observed_at":"2026-07-09T11:16:11.388106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-16T04:25:26.189213Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:39607d3cdbbb0dfb8f5b1581d48b801c21bb1946147e6c55a00ec008b348f362","observation_id":"8148a7e5-e65c-4119-b98f-7bc318c68640","resolution":{"observed_at":"2026-07-09T11:16:11.361536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.392050Z","title":"Miao Xiong, Zhiyuan Hu, Xinyang Lu, Yifei Li, Jie Fu, Junxian He, and Bryan Hooi","venue":null,"work_id":"feca12a9-866b-4aab-8a0b-d91e64c55b06","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:c8234d847c83b14f5a7b8bdf79f80906ab07b9df7259d644c0c2fef780e13a52","observation_id":"20eb2f64-cb0c-4e91-b943-b0c94bba18ae","resolution":{"observed_at":"2026-07-09T11:16:11.393946Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":"2504.20571","doi":"10.18653/v1/2024.acl-long.643","metadata_source":"pith","pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","venue":"cs.LG","work_id":"75a5258b-4143-4f2f-99f3-6d950a496305","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:bb3a64fa2795eb69dd841b62d95c31234c11ca2b9bd8e89af1ac5e1c34cfd76e","observation_id":"5b01ef1b-9cf8-4dbf-9158-8d55ba54e72a","resolution":{"observed_at":"2026-07-09T11:16:11.387942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:550230496f289637e6e6e8ed5add10dcb1045d67bc3d74a6356a4ca772b49f18","observation_id":"3f847dfc-dd58-4782-98ab-0a6cb32887bc","resolution":{"observed_at":"2026-07-09T11:16:11.366321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21798","last_updated":"2025-05-21T17:21:45Z","snapshot_observed_at":"2026-08-11T02:21:44.551484Z","submitted_at":"2025-04-30T16:56:06Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2504.21798","doi":"10.48550/arxiv.2504.21798","metadata_source":"pith","pith_arxiv_id":"2504.21798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","venue":"cs.SE","work_id":"6a906763-2e4e-4cea-a19c-d7a169c9376b","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2504.21798","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:4cb0057d5a3e4f51cb2d4a36be0f383d90b9617f483252d8a7c7aa977d9030ed","observation_id":"a93dd69b-62cc-4eb5-861c-0cde563cb671","resolution":{"observed_at":"2026-07-09T11:16:11.318401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:3b65d1aa0c662c7ba27d64d66bf0b97fa2f3fd913147f9de6cb981231b20054a","observation_id":"8c9409aa-ee97-427b-a6e2-af585555535e","resolution":{"observed_at":"2026-07-09T11:16:11.360782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:3151d0ebeb13b5c8318293f6063ef1ba154585b531e23c5baef37b7ad6c2da27","observation_id":"ba6189f5-e6f4-4a7d-bb0b-5138b8c9a399","resolution":{"observed_at":"2026-07-09T11:16:11.371468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07745","last_updated":"2025-08-17T06:06:35Z","snapshot_observed_at":"2026-08-16T13:10:47.071835Z","submitted_at":"2024-10-10T09:23:26Z","title":"StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2410.07745","doi":"10.48550/arxiv.2410.07745","metadata_source":"pith","pith_arxiv_id":"2410.07745","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steptool: A step- grained reinforcement learning framework for tool learning in llms","venue":"cs.CL","work_id":"7871badd-3809-43e4-850a-44543d3225a9","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2410.07745","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:c85e206ecb261fe4a8525cbc4786b73a300fa4d523bb484b32ebfc5a8963e8f5","observation_id":"ae02f8ba-5a21-4114-bb82-ad1984456372","resolution":{"observed_at":"2026-07-09T11:16:11.390626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-18T19:37:22.484551Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":"2412.01981","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-07-09T11:16:11.353419Z","title":"Free process rewards without process labels.arXiv preprint arXiv:2412.01981","venue":"cs.LG","work_id":"2e7f1b6f-cacf-44e6-b91c-55389c39935d","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:a4f9eff55a54a7bd8936d3c366c3b31d73d4cc053ead1f9383c3475104370f9e","observation_id":"79109ab6-23c1-4cf8-92d0-1d657aea6bb6","resolution":{"observed_at":"2026-07-09T11:16:11.354882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09459","last_updated":"2026-08-09T14:06:24Z","snapshot_observed_at":"2026-08-15T05:17:57.940786Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":3},"cited_work":{"arxiv_id":"2604.09459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09459","snapshot_observed_at":"2026-07-09T11:16:11.379473Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","venue":"cs.CL","work_id":"b28c3265-685a-4be5-b6e3-cfcd46733d99","year":2026},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2604.09459","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:53f42085179df5b1b8cfa63e58d97f55fb31f485515e0bebd3fa77e4059089df","observation_id":"9d92d757-4540-435a-b8fd-b70cdcc849c2","resolution":{"observed_at":"2026-07-09T11:16:11.380852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:9bd828a39bd5f38b36f96de2110da817b0597f400b0ebb5a84da2521e24ac271","observation_id":"4cbc42ed-6ff0-4f90-9a42-1cc2f6b83698","resolution":{"observed_at":"2026-07-09T11:16:11.322505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:a7d94527d22f168dc5ea615347294e313a5fab8b4537f1a539eb3e2769f0f589","observation_id":"ab5052ff-f60f-462d-a3fe-4fb87f104a87","resolution":{"observed_at":"2026-07-09T11:16:11.341579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:5b4e32fbc3573185fd1a45c57f462374d0319e3db7b02c2dfb83ab53b9b13b8c","observation_id":"414a6a04-8634-45b8-8de5-fce0ac8c5b3d","resolution":{"observed_at":"2026-07-09T11:16:11.339361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.521918Z","title":"This appendix gives the full experiments","venue":null,"work_id":"39777014-43b9-4094-9835-b68fbeaa4521","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:4f0c13e1337e37146d1072f475ba5da7d8537ffeebd8b97593dfa81e913b3be9","observation_id":"886e91d1-f6b4-4582-ade4-f5e7c488cfdd","resolution":{"observed_at":"2026-07-09T11:16:11.523517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.526825Z","title":"On SWE-bench software repair [Jimenez et al., 2024] the natural potential is the fraction of hidden FAIL_TO_PASS tests an episode makes pass","venue":null,"work_id":"38128e14-ebf1-40f5-8e72-801c7cf46a9c","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:5b054f2b18beacb75ee0ac0ebd1738cb446bb6c2aeb2c76f89033db9e55a65ab","observation_id":"7edaf817-368b-426d-a2dc-dfe408ef7fbf","resolution":{"observed_at":"2026-07-09T11:16:11.528376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.519862Z","title":"Benefit appears only past a reachability threshold","venue":null,"work_id":"6df5ba07-f10c-47a1-9f39-b38c8d7f7887","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:60c716cd086b0b1551cd948af9655832c0fe7f79c8b1c2e801ccca7264a6e52f","observation_id":"8555e251-bec1-4240-82e7-c49646413fba","resolution":{"observed_at":"2026-07-09T11:16:11.521743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.512229Z","title":"fragility,","venue":null,"work_id":"288ee129-1262-4b7f-9132-d2db6fd8798a","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:c08518397416810ce8cce01a168dc3baff7025d87e4756947db4381a4316b234","observation_id":"3ec87f6f-a0c5-431c-bdf3-1c45ae51a97b","resolution":{"observed_at":"2026-07-09T11:16:11.513997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.524229Z","title":"any- valid-tactic","venue":null,"work_id":"167faa77-c2a0-4291-91e7-871d2991a1e3","year":2026},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:672a7380cab847693d49c050034074db006de11a4991db287b351fe61c2c174e","observation_id":"133097ed-8ffc-43ae-9a97-925b6d60e5ba","resolution":{"observed_at":"2026-07-09T11:16:11.526298Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.524360Z","title":"The learned critic is a poor training reward in every quadrant; its only robust use is offline diagnosis at the intent frontier","venue":null,"work_id":"f86f2ff7-70ff-4c11-8cc4-3efeb7e01b72","year":2023},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:986105eead23e3686240593094a83c881ea40c32283e5f33d9b892781277c98e","observation_id":"0c7ce4fd-3d7b-4cd1-adec-d7b0caeb0e9e","resolution":{"observed_at":"2026-07-09T11:16:11.526004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":6},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.07435."}