{"as_of":"2026-08-14T11:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc0bf07794d9c5b32526c905f62275c11aed4e0315424188e566c026aac2af90","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:39:38.006409Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:40:55.391008Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:40:07.852377Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:b8f68710c3eebe0a1f692e89854365a9422487238c1555366ff528e29dfcac96","observation_id":"f95ff518-c0a2-4cf2-ba9b-6f309bdde87b","resolution":{"observed_at":"2026-05-12T08:40:42.043925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-07T13:53:00.891477Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-14T01:19:35.519123Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:00.891477Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:8a27c1658932da5799df8d02c2dc0554f30ebc148146a727fe750c037f87a845","observation_id":"3e4079b9-57fd-495f-91f3-1d34e1693736","resolution":{"observed_at":"2026-08-07T13:53:00.891477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-06T21:55:00.569399Z","title":"Process reward models for LLM agents: Practical framework and directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-09T05:53:21.859449Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.569399Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:569b72568faa7254b1cbc06938495716034393bc10f9ffd09c02874f00d9a6be","observation_id":"46e7171b-ec46-4bee-b76d-f05f0060db78","resolution":{"observed_at":"2026-08-06T21:55:00.569399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2507.14200","last_updated":"2026-05-15T13:08:04Z","snapshot_observed_at":"2026-08-13T18:37:34.518584Z","submitted_at":"2025-07-14T16:17:11Z","title":"A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-21T23:26:38.457193Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2507.14200"},"observation_digest":"sha256:0a15e801eafb6ca9630ff3525f78c091449b7d45da5cdc718b1be69c67de2640","observation_id":"7b677e12-6bf5-45d4-a241-5e8c246a3fcc","resolution":{"observed_at":"2026-05-21T23:30:46.105396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":235,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:25e95c4cd67ff396b5936c061cdaea55aa9ef005dbb7cc0cbbdc405afbfd36b2","observation_id":"e9162390-ac2b-46fe-8592-48cd973764e3","resolution":{"observed_at":"2026-05-14T22:23:15.209112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-05T15:44:14.788155Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-08-14T02:13:33.243693Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:44:14.788155Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2508.19598"},"observation_digest":"sha256:ca931fd136c63761762a826532f258552136a164b6512d3b49d3e0302fc9e378","observation_id":"4baf07d6-19cf-4135-a5b3-e240d8b1c703","resolution":{"observed_at":"2026-08-05T15:44:14.788155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-05T12:24:02.368310Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-14T00:53:24.154749Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.368310Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8d00047ab08563425c40d76a7c779c27d2ff852078a24b2f27581229658c7e77","observation_id":"ef0ee11a-e246-440f-8cbe-5c3556f6446b","resolution":{"observed_at":"2026-08-05T12:24:02.368310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":268,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:37d71f390476030f8d6deebae90e778b757d603509437361f491499abc8bf5be","observation_id":"c4d0eb90-6505-4219-a8fb-e67540e346a8","resolution":{"observed_at":"2026-05-18T19:21:48.656981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-04T07:56:46.023170Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-08T21:42:31.396671Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.023170Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:02debc65649a58e8aa5c1195f93d30c69cdbd4abdb99c69d5fc11e839e6e9e82","observation_id":"69ce9a63-a132-439c-b4ef-6b5382d7eb0c","resolution":{"observed_at":"2026-08-04T07:56:46.023170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-03T03:04:43.473321Z","title":"Process reward models for llm agents: Practical framework and directions.arXiv preprint arXiv:2502.10325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.473321Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:c3fa2640443bcb19976b0be7b972b44ab35e3e9fb62d5b131cf69137581a10a0","observation_id":"8c44698b-6b8a-4b98-94a4-386534cb4aa6","resolution":{"observed_at":"2026-08-03T03:04:43.473321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2604.07851","last_updated":"2026-04-09T06:07:03Z","snapshot_observed_at":"2026-08-03T12:28:38.894496Z","submitted_at":"2026-04-09T06:07:03Z","title":"ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T17:29:34.145855Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2604.07851"},"observation_digest":"sha256:2ee94e9c001626b12d7b359454c7dc5f254472bcad0ecc9502522d7dbee5fa1b","observation_id":"735e5750-b183-46b6-acf9-150fa5b7b843","resolution":{"observed_at":"2026-05-11T06:41:38.272747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2605.06200","last_updated":"2026-05-07T13:09:31Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:09:31Z","title":"A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T10:41:46.675257Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2605.06200"},"observation_digest":"sha256:8449df3aa1ac6902c0cdcb11502702a861a3838e19869711157498511863c279","observation_id":"76ecb7bf-6c00-4e45-b94c-db02d10d2c44","resolution":{"observed_at":"2026-05-11T19:56:08.764793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2605.09934","last_updated":"2026-05-11T03:32:55Z","snapshot_observed_at":"2026-08-11T05:22:49.605607Z","submitted_at":"2026-05-11T03:32:55Z","title":"TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:06.869916Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2605.09934"},"observation_digest":"sha256:5d5764278c6319c61b53614cf8082614d2a8e4bed2534d695d82b681cd7f2946","observation_id":"d1017cb9-f713-412d-af1d-b9b8e08afcd1","resolution":{"observed_at":"2026-05-12T06:11:26.376883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2605.11235","last_updated":"2026-05-11T20:50:29Z","snapshot_observed_at":"2026-08-10T03:47:46.321583Z","submitted_at":"2026-05-11T20:50:29Z","title":"Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T02:19:27.345348Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2605.11235"},"observation_digest":"sha256:5e4f8522bedde1cf47ed3a623680d20422530eeaea84cb5d90caf9dab25498cd","observation_id":"ab9ed4e5-0ccb-48b8-8d12-bc2b2b370c58","resolution":{"observed_at":"2026-05-13T02:22:06.790866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.07027","last_updated":"2026-06-05T08:17:28Z","snapshot_observed_at":"2026-08-01T08:01:00.499508Z","submitted_at":"2026-06-05T08:17:28Z","title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T22:24:41.353303Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.07027"},"observation_digest":"sha256:cdfddf2fbe7b4ed80400c21822ec7247d8f1e46b809d18924d9c02c36b45fb0b","observation_id":"64ff4a60-ed75-4796-8d76-ca22865b8c53","resolution":{"observed_at":"2026-07-02T16:47:09.644058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.07367","last_updated":"2026-06-05T15:09:52Z","snapshot_observed_at":"2026-08-04T14:57:01.386223Z","submitted_at":"2026-06-05T15:09:52Z","title":"Self-evolving LLM agents with in-distribution Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T22:18:27.021136Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.07367"},"observation_digest":"sha256:dec133befc5b0d8f06e47ae0bf04c603a57ea6d534302c38f5e1b8386fdf462b","observation_id":"750b729d-0b41-4b49-85f6-316fd64d974a","resolution":{"observed_at":"2026-07-02T16:57:09.563002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-02T20:51:48.133765Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:50.123077Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:267d36af967d82788f250e6bbe17090f365fa2c08fe06260c6d653f9437ba771","observation_id":"ab4bda4e-7106-4530-bc4d-d072e9e97af4","resolution":{"observed_at":"2026-07-04T06:19:38.638684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-02T10:43:52.874792Z","title":"Process reward models for LLM agents: Practical framework and directions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-02T20:51:48.133765Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T10:43:52.874792Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:24ba160027356acd36054fe710e3257edb01622e45ddbebb4540274ec4677b5f","observation_id":"2811bb84-3870-4bee-964b-335b758adde9","resolution":{"observed_at":"2026-08-02T10:43:52.874792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.21399","last_updated":"2026-06-19T13:08:17Z","snapshot_observed_at":"2026-07-06T23:56:26.805329Z","submitted_at":"2026-06-19T13:08:17Z","title":"Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:24:38.527103Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.21399"},"observation_digest":"sha256:759871185f21d85118ec047e5891b98267257e1753b1850daa82b2a556327882","observation_id":"24e18af3-2760-4054-af69-5b4f913f1edf","resolution":{"observed_at":"2026-07-04T06:29:37.873379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:7efa9f1f7622eede113b64eb75a11ba091ebb4114efd780a83eab7d76323e09b","observation_id":"1dbb1f91-93d6-4b4a-a8a2-d9717bde3001","resolution":{"observed_at":"2026-07-04T09:59:44.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.25852","last_updated":"2026-06-24T14:02:13Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:02:13Z","title":"Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-25T20:16:39.347676Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.25852"},"observation_digest":"sha256:7c0cb9a58980d283976e14cd374d7833825b52b9b121dc1d9ee0820d87746d3c","observation_id":"63338ea6-52ae-41cc-a02b-f373b9e1161b","resolution":{"observed_at":"2026-07-04T20:20:07.668163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.26080","last_updated":"2026-06-24T17:54:08Z","snapshot_observed_at":"2026-08-02T15:38:18.729836Z","submitted_at":"2026-06-24T17:54:08Z","title":"Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T19:55:51.114244Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.26080"},"observation_digest":"sha256:bc5ca3f58a9a3233a70da41d727f8a02bb2997b40ecbc2d6be363ea91b8e4557","observation_id":"4694c7c6-38ac-4a83-aab6-7911e90eeabb","resolution":{"observed_at":"2026-07-04T20:40:07.853911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":"2502.10325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-07-04T20:40:07.852377Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":"7770478b-9aa2-4e18-a113-729fbe69a4de","year":2025},"citing_paper":{"arxiv_id":"2606.29745","last_updated":"2026-06-29T03:42:01Z","snapshot_observed_at":"2026-08-04T21:51:46.402646Z","submitted_at":"2026-06-29T03:42:01Z","title":"ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T04:36:35.213066Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2606.29745"},"observation_digest":"sha256:e3c6f923ee2e05554eed0bf6a4d35a627f734cb64e56ea020a2fb3a8f1202e26","observation_id":"c7939e92-aad6-47c9-bf80-6d2e901c8b1c","resolution":{"observed_at":"2026-06-30T16:44:56.609798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-01T18:53:08.965286Z","title":"arXiv:2502.10325 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17149","last_updated":"2026-07-19T09:14:27Z","snapshot_observed_at":"2026-08-11T00:49:46.665606Z","submitted_at":"2026-07-19T09:14:27Z","title":"A Diagnostic Framework for AI Agent Behavior","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T18:53:08.965286Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2607.17149"},"observation_digest":"sha256:7ce630bbebf65d8c140331e2aad9712fe6abe3b5e71b810ad03cb995764732d0","observation_id":"fd198367-8d74-4d80-8bef-178f768b551c","resolution":{"observed_at":"2026-08-01T18:53:08.965286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-14T04:40:55.391008Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08389","last_updated":"2026-08-09T00:56:37Z","snapshot_observed_at":"2026-08-14T04:34:32.217627Z","submitted_at":"2026-08-09T00:56:37Z","title":"Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T04:40:55.391008Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2608.08389"},"observation_digest":"sha256:a677c336cdb0f75aedbfd030c43f320204acf549f4390a790ac163f655cee620","observation_id":"f81e7495-b455-4cc6-a571-75adc88caacb","resolution":{"observed_at":"2026-08-14T04:40:55.391008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10325/citation-record","integrity":"/paper/2502.10325/integrity","json":"/paper/2502.10325/citation-record.json","paper":"/paper/2502.10325"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.609158Z","title":"Step: Stacked llm policies for web actions","venue":null,"work_id":"2cf4bcc4-5573-4492-b38c-5030a8e08e9d","year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.769548Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:53b5dcd5e0ed769412c7090c4e8fb5297694c73e019a6951c0e6b16e670d8a4f","observation_id":"c4a19a37-a103-41c0-9aa5-3e89233f0f4a","resolution":{"observed_at":"2026-08-07T18:39:38.613373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T18:39:37.773506Z","title":"pi0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.773506Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:a2d0dae4c89151d1d0f1c7118d30c5be81d02558356a996148982e453a87c564","observation_id":"544ebe5c-dfac-470b-8f68-28bfd3b71537","resolution":{"observed_at":"2026-08-07T18:39:37.773506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T18:39:37.778546Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.778546Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:2b446a84aa62c40c0be795e6f4aa92e679939c61b4abe220cf957cba9c87b371","observation_id":"3afccf7a-92d7-478e-9c8c-92f9e4512480","resolution":{"observed_at":"2026-08-07T18:39:37.778546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T18:39:37.783337Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.783337Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:c3c7b7a31fbf3454b8413d9c759836b20d133b9da82d71cd224e010477332bbf","observation_id":"42548ea1-5dc7-40ea-8817-b7bb4fddd832","resolution":{"observed_at":"2026-08-07T18:39:37.783337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-10T17:44:16.302071Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-07T18:39:37.788032Z","title":"Reflexion: Language agents with verbal reinforcement learning.(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.788032Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:00626ea9e1319fce096ab761b8066d3ed3c7a0aa58304be4ef777b135acb9951","observation_id":"47b6553b-c943-4114-b24b-5cfea61ec524","resolution":{"observed_at":"2026-08-07T18:39:37.788032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.793329Z","title":"Fireact: Toward language agent fine-tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.793329Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:0eda19f3f442ea319ba56f136670c96d6e1d5bfec2a49b60d2470f8821f27ce8","observation_id":"72bcb666-d5b4-4310-a92d-14213dc0e295","resolution":{"observed_at":"2026-08-07T18:39:37.793329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02406","last_updated":"2023-04-11T19:39:17Z","snapshot_observed_at":"2026-08-10T13:37:57.622090Z","submitted_at":"2022-10-05T17:28:20Z","title":"Decomposed Prompting: A Modular Approach for Solving Complex Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02406","snapshot_observed_at":"2026-08-07T18:39:37.797982Z","title":"Decomposed prompting: A modular approach for solving complex tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.797982Z"},"links":{"cited_paper":"/paper/2210.02406","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:33618446d1d5b08623fb9ae173bff33136487188b8250d76da6be42b847f4212","observation_id":"4f80b961-a6b3-4f94-90de-6b1eed3ba107","resolution":{"observed_at":"2026-08-07T18:39:37.797982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T18:39:37.802927Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.802927Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:f49defa91414ae1cd6d7ece2d3510f3d4270fea1f2903929fe0a3cde1b97c793","observation_id":"abb81628-ae03-4ac8-a6f1-c9f7a4fe9f89","resolution":{"observed_at":"2026-08-07T18:39:37.802927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.807987Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.807987Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:0c7628c64bc5ec825a22210fe02eb170ed2b56368175275f4f9128107b3ee085","observation_id":"795341fa-f86d-4957-9fc0-5dba5cfc891b","resolution":{"observed_at":"2026-08-07T18:39:37.807987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T18:39:37.812425Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.812425Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:1201401df44eb3a90246e1f77031c8be2330076e4078a9c6063e11f9ae31f095","observation_id":"865e7792-c477-415c-bb8c-12224dca57a6","resolution":{"observed_at":"2026-08-07T18:39:37.812425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T18:39:37.817543Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.817543Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:65ecbf82f23f1f55464c4d7eaeec06ae5cc71e2c4e3d53195f78eebdab9ba05b","observation_id":"46fd1c97-dbad-4f5d-a1fc-f50c27e64761","resolution":{"observed_at":"2026-08-07T18:39:37.817543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T18:39:37.823226Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.823226Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:333435b95228c039f576c6651b91e741b0d768b316946bd5255d3d87cfe1a5b1","observation_id":"75077441-2f49-42de-9c94-49732407c624","resolution":{"observed_at":"2026-08-07T18:39:37.823226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.828413Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.828413Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:cbdaf037763f97258fba19dca32a7207d39e56706f7c00d94fe916d063b220aa","observation_id":"14972fb4-64bb-42ef-a4bb-5adc0b21d005","resolution":{"observed_at":"2026-08-07T18:39:37.828413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.572909Z","title":"Trl: Transformer reinforce- ment learning","venue":null,"work_id":"b1f694a4-56db-4034-94b4-ddd593b02a5b","year":2020},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.832427Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:4c7b4a47cb92e63903d537f3106bb8141cce7fcfca1e301f1f909d40000d6496","observation_id":"9cbdf9f7-fb8d-423a-890a-7227154da4da","resolution":{"observed_at":"2026-08-07T18:39:38.577236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.560415Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"bf1d206e-af28-4a1a-870e-e3cabfea3175","year":2020},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.837193Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:70b8ef9876e57454df9531ac9c7c0f99b9035569ce2d14c67f5b31918e1d615c","observation_id":"85075978-3419-4847-9b71-1bfabbf77a6b","resolution":{"observed_at":"2026-08-07T18:39:38.564620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.841455Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.841455Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:e09e8ff115c0522032cc1a8f468ef62ce62fda586f7b1ee0359b2811a92ef224","observation_id":"6d609886-5765-4909-9e77-13fddea298f3","resolution":{"observed_at":"2026-08-07T18:39:37.841455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T18:39:37.846166Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.846166Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:7445864b47e683c81f0721eceac3af8b5465b0c9c088461ed90a9089dbdd2de5","observation_id":"cb6ae2fc-b4b4-4ef9-9707-b4925880981f","resolution":{"observed_at":"2026-08-07T18:39:37.846166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T18:39:37.850883Z","title":"Sglang: Efficient execution of structured language model programs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.850883Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:c5652dec0307598650e10fa18efa25bb29e8fd3e8f383cc9bc75aa165ca36fd3","observation_id":"2f8d128d-da9f-4de8-aaaf-7aa5796d1fa1","resolution":{"observed_at":"2026-08-07T18:39:37.850883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.855683Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.855683Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:f92aa743b4a9bf16d1bb94939213933fd824c31dc509cf3a6da12af2cb2933c0","observation_id":"480c3fff-be9a-4d01-90fa-ca98236fc61d","resolution":{"observed_at":"2026-08-07T18:39:37.855683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T18:39:37.859703Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.859703Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:1e7e7a4dc050130b89c73ddbd441b26008e44d6d6d3787d572ceac07c5d98d6f","observation_id":"fa296111-14c9-4750-8da9-c34cd389ed1e","resolution":{"observed_at":"2026-08-07T18:39:37.859703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-14T00:12:09.918230Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T18:39:37.864500Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.864500Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:7e01a8b6c510ef3b203865da3bf0dc7727ff81a1ce73ded82e56f5e0638ba1bf","observation_id":"238780b0-f35b-4771-8497-9b696b970edf","resolution":{"observed_at":"2026-08-07T18:39:37.864500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T18:39:37.868713Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.868713Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:ef336c22985972646ce07269c41c53b0ec644a799eab36011d55e41f791e215b","observation_id":"940adcd1-0907-4494-98a3-a84a8a47de01","resolution":{"observed_at":"2026-08-07T18:39:37.868713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.533335Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"d07f1b12-757c-41e8-8384-cd167c84d196","year":2002},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.873203Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:54dba945088c4da931ce067dc508b6ba1756c7de798832d751d037b1f74c7733","observation_id":"45ee08a1-44e9-4689-b40c-b0b6cbfba721","resolution":{"observed_at":"2026-08-07T18:39:38.538108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-07T18:39:37.876369Z","title":"Alfworld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.876369Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:63788501ce3aea283782db3f114e9297329bb9711de16b979faa0e800751781c","observation_id":"20e198df-fcc8-49c0-a158-c3d59f5a49c0","resolution":{"observed_at":"2026-08-07T18:39:37.876369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-07T18:39:37.880327Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.880327Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:665a2bcca60e6df57ea563b8d2372c49e69b7282204d47081127a10d5da75b5e","observation_id":"47c2017d-dc43-4906-b04b-f2f1c83551b6","resolution":{"observed_at":"2026-08-07T18:39:37.880327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.883873Z","title":"Expel: Llm agents are experiential learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.883873Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:eef070dc525339e22c286ac9c24e35fbe585a4bd6d6e22a03c319e0184558c6b","observation_id":"7540d552-8a8b-4cc8-95dc-7404d5504fe3","resolution":{"observed_at":"2026-08-07T18:39:37.883873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.513915Z","title":"Adaplanner: Adaptive planning from feedback with language models","venue":null,"work_id":"4d2b779b-8514-416d-8973-0f3a7a4e8adb","year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.888101Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:05d8aa6d8b488b8225239f9264abefc3b043f0a69830dd2c4a9aeca88d271b3b","observation_id":"30be6acc-cfc4-40fe-adc3-c181d7b2dedb","resolution":{"observed_at":"2026-08-07T18:39:38.518028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.502610Z","title":"Specification gaming: the flip side of ai ingenuity","venue":null,"work_id":"a7bd63dc-684d-4088-9518-9134f2f72c15","year":2020},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.891380Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:2990b471c2d2888ec5baa758aa2cdab9c48ba6487cbd889a6f9c0496f5ff27d5","observation_id":"7cdd03be-64ae-47f4-9570-d595f98f981d","resolution":{"observed_at":"2026-08-07T18:39:38.506420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.491523Z","title":"Reward hacking","venue":null,"work_id":"5b7db12a-d68c-4890-bda7-0074167f5bdc","year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.895086Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:e31d257f4a52e1ff19b4b986d29d4d36956458f4cb508f6b71c24c552565383d","observation_id":"acf07846-add6-4c65-8f52-42a23a81bfd8","resolution":{"observed_at":"2026-08-07T18:39:38.494882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.898874Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.898874Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:f3c7b633b64f0181909956852717e96f07a1ec416ea63e474717be79c33e79d9","observation_id":"e9fadb62-7de0-4a95-bd4c-860a6a6e6b0d","resolution":{"observed_at":"2026-08-07T18:39:37.898874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-13T04:40:05.019883Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-07T18:39:37.902896Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.902896Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:2138f51f40bf61a9dd6cc6d03ee0d07f439e5e707de46052405d116a3a1bbc68","observation_id":"a3e78fb8-059f-4345-8f08-a6e238ab33e5","resolution":{"observed_at":"2026-08-07T18:39:37.902896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.907824Z","title":"Iq-learn: Inverse soft-q learning for imitation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.907824Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:fc8491094444f4224b2df07e4b979ba5cfc1aacdf817267961691d5a37bcfc4d","observation_id":"23838738-6982-4d19-ba4c-4bd32154662b","resolution":{"observed_at":"2026-08-07T18:39:37.907824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.465316Z","title":"Q* approximation schemes for batch reinforcement learning: A theoretical comparison","venue":null,"work_id":"7f35b391-afa0-449c-bb67-7e522d687066","year":2020},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.911571Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:4eacb11eefd6e89ae2b64cdc1a2076f80601f941d8cc6191fd7c70d4497d10e3","observation_id":"de5e6fa7-7e9d-45d7-9be7-329845718221","resolution":{"observed_at":"2026-08-07T18:39:38.469910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05434","last_updated":"2024-10-07T18:55:53Z","snapshot_observed_at":"2026-08-14T05:26:44.054046Z","submitted_at":"2024-10-07T18:55:53Z","title":"Better than Your Teacher: LLM Agents that learn from Privileged AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05434","snapshot_observed_at":"2026-08-07T18:39:37.915767Z","title":"Better than your teacher: Llm agents that learn from privileged ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.915767Z"},"links":{"cited_paper":"/paper/2410.05434","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:3766f696eff3ae9595de79268268f458f28c4ad677e37d17a6db84207bb191d2","observation_id":"1d4189ef-0bfb-401f-9c73-96bf7b58654b","resolution":{"observed_at":"2026-08-07T18:39:37.915767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.452116Z","title":"Inverse reinforcement learning without reinforcement learning","venue":null,"work_id":"7e7239bf-2d9a-4052-83ed-a6b1956e4571","year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.920612Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:20bc9826ace6da1d8eebecb357cfe31c3d908979a250421eac2259cda2bb1145","observation_id":"0ff61f82-f325-4891-85bc-ac7f2d5a3d9f","resolution":{"observed_at":"2026-08-07T18:39:38.456384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.439800Z","title":"Policy search by dynamic programming","venue":null,"work_id":"de6c6811-0695-4dd1-8f0b-aa37f2cd1734","year":2003},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.924821Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:c62bfacc953c88815fe9114781e4c766ba1f4f0f038e9a5729aa189db1c108eb","observation_id":"536882f9-2500-4b91-ad23-5ae28625e367","resolution":{"observed_at":"2026-08-07T18:39:38.444147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.929780Z","title":"(more) efficient reinforcement learning via posterior sampling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.929780Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:58acd57664b1afbe88dc21f4cf7c2e4f43af3b1d610e4c7f0f885e56b76d07e8","observation_id":"c9fa1438-73ad-46d2-a0fe-2ac4cd37db80","resolution":{"observed_at":"2026-08-07T18:39:37.929780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.420124Z","title":"Sequence model imitation learning with unobserved contexts","venue":null,"work_id":"28e1737f-fa9d-4038-bc8a-164fbca40b11","year":2022},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.933921Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:91abb39100ef89be5c005b0f111a8846cd78d15ac8cd414c55393c6bf3daa5c9","observation_id":"d4af72bf-b343-4303-97d6-e6883edf15fc","resolution":{"observed_at":"2026-08-07T18:39:38.424316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.407681Z","title":"Data-driven planning via imitation learning","venue":null,"work_id":"1b23e5cb-a75f-444f-95d8-79b079889f02","year":2018},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.939188Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:eccc4a64bf3d9174e18bf6f8e9dcf92d2f3abe9e6c63ab98ba644ad3de1b6c60","observation_id":"4f327c8a-59a6-4dc9-a50e-ddad0f33dad2","resolution":{"observed_at":"2026-08-07T18:39:38.411598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.394380Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"3676ddf3-4d54-4ec0-999b-4f71bf8947ed","year":2011},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.943371Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:ebc14b47ec3a570d6856b5040cd0ba22ca995b2f24f6189313225bf916dc83a7","observation_id":"dc7d1419-d01e-4ced-8706-81e920bfd194","resolution":{"observed_at":"2026-08-07T18:39:38.399365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-08-07T18:39:37.948274Z","title":"Reinforcement and imitation learning via interactive no-regret learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.948274Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:45a7c9f365c635a2ef959047d440b20936c34df7a1dce94c938903d910834099","observation_id":"43cafe49-345a-4fb5-833a-27e5436e9c9d","resolution":{"observed_at":"2026-08-07T18:39:37.948274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.382597Z","title":"Deeply aggrevated: Differentiable imitation learning for sequential prediction","venue":null,"work_id":"7f577033-ecd5-46bf-a815-fcf6027dc5c4","year":2017},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.952283Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:f1b6e61b650bf7fca361a477e3314011ac8dcf7b1722a22fc4c13366c421b84b","observation_id":"69f4abdb-ad3c-4dde-98c1-bb180b8d91bb","resolution":{"observed_at":"2026-08-07T18:39:38.386533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.371691Z","title":"An application of reinforcement learning to aerobatic helicopter flight","venue":null,"work_id":"1931ef38-ad89-4050-b128-a4dcf047f95a","year":2006},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.956574Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:01fd79a893496e5f60d77185cf3e2e09c97ee143887dc8166a2c122088fbe453","observation_id":"99c9dd62-a3a6-4702-aa67-06c87b1fb4fa","resolution":{"observed_at":"2026-08-07T18:39:38.375311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:37.961506Z","title":"Learning dexterous in-hand manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.961506Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:c0532eb16cf4303a55680842a081a7e6d996b4a78f62f8a3ab242849bc4ef5bd","observation_id":"70f67bdd-8ec0-45ba-92ab-761890ded74f","resolution":{"observed_at":"2026-08-07T18:39:37.961506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:39:38.352332Z","title":"Model-based reinforcement learning with a generative model is minimax optimal","venue":null,"work_id":"b9706964-b944-4fbe-ba10-284702648604","year":2020},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.965190Z"},"links":{"citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:6bd09fc9ee74b0f3d4954ea4b6f4b7f04bb2313df1ee4524241184a7ad18217d","observation_id":"af5b97ec-dc3c-4ed0-8bda-5cb18d802ef3","resolution":{"observed_at":"2026-08-07T18:39:38.357863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-13T14:09:17.964744Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-07T18:39:37.969168Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.969168Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:0624022e284e2772be746b413d730ca35283b0d0e92594b1524bb5b9e6eda7a4","observation_id":"457d090c-c7d2-4f26-bd28-09183312eb08","resolution":{"observed_at":"2026-08-07T18:39:37.969168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-07T18:39:37.974199Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.974199Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:42bbd50a101886ae1ba65879660ef0865ab65b8fecc3154647b97a90f3019189","observation_id":"e42f8356-178c-4eef-ad20-ca3a0fd8591c","resolution":{"observed_at":"2026-08-07T18:39:37.974199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-13T05:45:19.606713Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-07T18:39:37.978380Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.978380Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:74cd0c8bbcacfe735f91982953f9bb4d74713c27a834661774de622bf66fee4c","observation_id":"4981e9e1-0e35-4790-817d-1e1059a38d25","resolution":{"observed_at":"2026-08-07T18:39:37.978380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-13T04:06:49.620740Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T18:39:37.983121Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.983121Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:d0c5d25b9d909525c67094e165ed7824bbdb11bd82ed452e704292642b69d126","observation_id":"11484c73-dde9-4c93-aa03-456ef3ded975","resolution":{"observed_at":"2026-08-07T18:39:37.983121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T18:39:37.986993Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.986993Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:60df26bb167b336001ee952b4856eac8699e32c9d7198e3df9ad7e123b446e81","observation_id":"9adc526c-84b4-43c9-8e7d-71b06f5a52f1","resolution":{"observed_at":"2026-08-07T18:39:37.986993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T18:39:37.991227Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.991227Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:5a471a4b6e80bc08e964dd7764557c9dc7ddc3043f2ba030c54041e8e0db1e65","observation_id":"d7130766-2dc1-4947-8e84-3b1fe1efe616","resolution":{"observed_at":"2026-08-07T18:39:37.991227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T18:39:37.994928Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.994928Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:e7facc9e3e5e04c9d19a75735645aaf82994ac75fd24fb6f3aa602bed4889ab8","observation_id":"8971eb30-f7e4-4df1-bb88-cf78aa2f2fcf","resolution":{"observed_at":"2026-08-07T18:39:37.994928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-08-13T05:48:49.091450Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-07T18:39:37.998225Z","title":"Let’s reward step by step: Step-level reward model as the navigators for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.998225Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:f743a4f94ce26aa6506763f29d1356f421eaadfb82e22dad1b7c598bdf24aefb","observation_id":"63542aa5-0688-4083-970c-3d12a35bb618","resolution":{"observed_at":"2026-08-07T18:39:37.998225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-07T18:39:38.001803Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:38.001803Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:d21b420f14cd449f6433b7819be7044bec273b6a5a3d4765da5f31cf3c6435c8","observation_id":"b525f024-300e-443d-b921-1ffd9a720aab","resolution":{"observed_at":"2026-08-07T18:39:38.001803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-13T00:59:58.573803Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T18:39:38.006409Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:38.006409Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:353599ab86694bfb4cae3f53cd0ae809a95e51e150c91aac3891c599d14bcac6","observation_id":"c98a33f2-13cf-4e37-974c-51909915dc0d","resolution":{"observed_at":"2026-08-07T18:39:38.006409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 25 inbound Pith citation observations for arXiv:2502.10325."}