{"as_of":"2026-08-15T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9b143a12f50a45134765e105b119e1d1412c0f9b125bc3ea8565c1957c1ab57","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:20:31.002411Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08255/citation-record","integrity":"/paper/2608.08255/integrity","json":"/paper/2608.08255/citation-record.json","paper":"/paper/2608.08255"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-14T15:03:39.227865Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-12T00:20:30.881986Z","title":"Test-time adaptation for llm agents via environment interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.881986Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:9b6bce530c6b586684d24ab737986a537e8632777f7d0d2f73182a95fd63e9af","observation_id":"d90394ae-8bf4-421a-81a6-97acf69a6280","resolution":{"observed_at":"2026-08-12T00:20:30.881986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-12T00:20:30.898822Z","title":"Lang Feng, Zhenghai Xue, Tingcong Liu, and Bo An","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.898822Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:c8ea39aa864626653fc15331a0b281d118958d856ac9e831cf155de1626a2266","observation_id":"5dc7db82-d1bf-4bd7-a164-b663e62831fd","resolution":{"observed_at":"2026-08-12T00:20:30.898822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-08-13T11:38:32.822078Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-08-12T00:20:30.903845Z","title":"Hiroki Furuta, Ofir Nachum, Kuang-Huei Lee, Yutaka Matsuo, Shixiang Shane Gu, and Izzed- din Gur","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.903845Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:c005cc62bbcaee919fd4c5a04f549f4f95d5eef7c2ac55768dd51a91a48b6a22","observation_id":"fb549041-a873-461a-8fb4-e4a36e6be90a","resolution":{"observed_at":"2026-08-12T00:20:30.903845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:20:30.915025Z","title":"Shuo He, Lang Feng, Qi Wei, Xin Cheng, Lei Feng, and Bo An","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.915025Z"},"links":{"citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:e7e78633169e13faf4fdce75ea45577dea1450bf03e32ae21f2fe0749fe3dd18","observation_id":"5f552ab7-7564-4b60-9ea0-0f450dc67aa4","resolution":{"observed_at":"2026-08-12T00:20:30.915025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.16995","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16995","snapshot_observed_at":"2026-08-12T00:20:31.411452Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","venue":"cs.CL","work_id":"2b27bc3e-a652-42ec-8d33-96b556e54fb9","year":2026},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.920209Z"},"links":{"cited_paper":"/paper/2604.16995","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:50ea152deb6ef62b8668818ec1b1225735903f1765615861804cea3d3524127c","observation_id":"f1bdb373-645c-4c2d-b478-0a7e8fc05de0","resolution":{"observed_at":"2026-08-12T00:20:31.418525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04617","last_updated":"2025-07-18T17:06:00Z","snapshot_observed_at":"2026-08-12T22:49:41.167525Z","submitted_at":"2024-09-06T21:00:57Z","title":"Sparse Rewards Can Self-Train Dialogue Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04617","snapshot_observed_at":"2026-08-12T00:20:30.924964Z","title":"Barrett Martin Lattimer, Varun Gangal, Ryan Mcdonald, and Yi Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.924964Z"},"links":{"cited_paper":"/paper/2409.04617","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:449ff054e7d97a9b27530014c2a5f1864808f8f0168a6ea7a9f5202f826dfb56","observation_id":"20d99a4f-11f2-4944-b987-753ae45f1b6c","resolution":{"observed_at":"2026-08-12T00:20:30.924964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-12T00:20:30.935549Z","title":"Hunter Lightman, Vineet Kosaraju, Yura Burda, Harrison Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, and Karl Cobbe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.935549Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:c03aaeade7636179217a2b99351b54364b0bee0a1860410118d44257d75b971e","observation_id":"951ad88b-d8f3-4151-8833-7524d42e3994","resolution":{"observed_at":"2026-08-12T00:20:30.935549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01072","last_updated":"2024-07-04T09:32:18Z","snapshot_observed_at":"2026-08-13T05:11:59.076600Z","submitted_at":"2023-12-02T08:49:51Z","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01072","snapshot_observed_at":"2026-08-12T00:20:30.941220Z","title":"Eduardo Pignatelli, Johan Ferret, Matthieu Geist, Thomas Mesnard, Hado van Hasselt, and Laura Toni","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.941220Z"},"links":{"cited_paper":"/paper/2312.01072","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:3ea89287bb2e379ae5f6dd1f6942d9a95cff62cea3ad58b32df659acb07bd81f","observation_id":"0a1e9ed0-3451-4c16-857d-22bd399370dc","resolution":{"observed_at":"2026-08-12T00:20:30.941220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-12T00:20:30.951443Z","title":"11 Timo Schick, Jane Dwivedi-Yu, Roberto Dess `ı, Roberta Raileanu, Maria Lomeli, Luke Zettle- moyer, Nicola Cancedda, and Thomas Scialom","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.951443Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:905130b19f9c9ea7d14dd2c4997da030d41b8023e1930cae7dc97d9c14d300e9","observation_id":"9385ed41-af56-4b1d-8836-f1b0e782bdd0","resolution":{"observed_at":"2026-08-12T00:20:30.951443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T00:20:30.956539Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.956539Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:425ac9317db1867e07ecfe11d54a2a196c398f3cd593a033b6aaedc0541f175a","observation_id":"ef0a00af-47bd-490e-adbb-aca16bc14dad","resolution":{"observed_at":"2026-08-12T00:20:30.956539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-12T00:20:30.966366Z","title":"Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Cˆot´e, Yonatan Bisk, Adam Trischler, and Matthew J","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.966366Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:b0d5ea8bf78da9a722a397f4a024a4a8bc77af557f55bddeb593b45bd495026d","observation_id":"284107c9-dd1b-4155-b113-ab125fd0a0fc","resolution":{"observed_at":"2026-08-12T00:20:30.966366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:20:30.977076Z","title":"Chenglong Wang, Hang Zhou, Yimin Hu, Yi Huo, Bei Li, Tongran Liu, Tong Xiao, and Jingbo Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.977076Z"},"links":{"citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:b214e44c085466ab555d96edf9bd2830595dfa5c11fce7d529566dade708083b","observation_id":"15cddf84-14e0-4aa5-990a-35b31922c348","resolution":{"observed_at":"2026-08-12T00:20:30.977076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T00:20:30.982441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.982441Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:9d021a898643cc1f885100a79fd658cca0773174dc42d11830e5299c31989593","observation_id":"1e85fd38-0071-47a6-93d1-ab29797e7564","resolution":{"observed_at":"2026-08-12T00:20:30.982441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01206","last_updated":"2023-02-08T01:39:30Z","snapshot_observed_at":"2026-08-13T15:11:12.622778Z","submitted_at":"2022-07-04T05:30:22Z","title":"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01206","snapshot_observed_at":"2026-08-12T00:20:30.987486Z","title":"org/CorpusID:274859421","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.987486Z"},"links":{"cited_paper":"/paper/2207.01206","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:eac8653634c36f4a56e9f43722e863e7533d1d6c7779acaa054d5bd0bd3ec685","observation_id":"ea9b2aac-c0ec-4774-ac53-d88079310eaf","resolution":{"observed_at":"2026-08-12T00:20:30.987486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-14T13:45:32.469908Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-12T00:20:30.992560Z","title":"Yufeng Yuan, Yu Yue, Ruofei Zhu, Tiantian Fan, and Lin Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.992560Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:a77d246c66ecfb013fe6f6cd5dd1092b1c995b2ef2068cf0fd7d2c2252863672","observation_id":"af1ee5bb-ac15-47a5-a867-87075d555589","resolution":{"observed_at":"2026-08-12T00:20:30.992560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-12T00:20:30.997565Z","title":"semanticscholar.org/CorpusID:276766648","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.997565Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:fd36ee4c6cfbaa9329d789ced39b17b6e3f87449ae0b85d897b20a7e4fc44629","observation_id":"47e83f44-986d-4074-9e94-65de6da1013a","resolution":{"observed_at":"2026-08-12T00:20:30.997565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11667","last_updated":"2024-03-22T18:52:15Z","snapshot_observed_at":"2026-08-13T05:47:11.218692Z","submitted_at":"2023-10-18T02:27:01Z","title":"SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11667","snapshot_observed_at":"2026-08-12T00:20:31.002411Z","title":"Xuhui Zhou, Hao Zhu, Leena Mathur, Ruohong Zhang, Haofei Yu, Zhengyang Qi, Louis philippe Morency, Yonatan Bisk, Daniel Fried, Graham Neubig, and Maarten Sap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:31.002411Z"},"links":{"cited_paper":"/paper/2310.11667","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:08d87399bc97989e410324c706139bf6940e83a2664965cd55464f129d98abe5","observation_id":"8165469f-0a38-4d57-b00c-5c60b6b73de1","resolution":{"observed_at":"2026-08-12T00:20:31.002411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:20:30.972193Z","title":"Hindsight credit assignment for long-horizon llm agents.ArXiv, abs/2603.08754,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.972193Z"},"links":{"citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:8e1e4a956851fa6c3063253c6abe0cd160dc80ddb7cc36645651607550864880","observation_id":"40ac6398-d796-43b4-a6a3-86c19e1940d7","resolution":{"observed_at":"2026-08-12T00:20:30.972193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-12T00:20:30.961438Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Jun-Mei Song, Mingchuan Zhang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.961438Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:5d893278a049c239825ad921da4b63b4ee8b787fd9ff752602ef1c7568acbb4d","observation_id":"d5caeca4-f423-4630-a461-424602baec20","resolution":{"observed_at":"2026-08-12T00:20:30.961438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12856","last_updated":"2024-02-25T16:17:43Z","snapshot_observed_at":"2026-08-14T05:33:25.547274Z","submitted_at":"2023-07-24T14:56:30Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12856","snapshot_observed_at":"2026-08-12T00:20:30.909215Z","title":"Izzeddin Gur, Hiroki Furuta, Austin Huang, Mustafa Safdari, Yutaka Matsuo, Douglas Eck, and Aleksandra Faust","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.909215Z"},"links":{"cited_paper":"/paper/2307.12856","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:d7313ebd200384395c4058e2e006956c97473120f44130177d85e0176f59ab9c","observation_id":"db603c01-77a3-440a-b6ab-8265efc89ac8","resolution":{"observed_at":"2026-08-12T00:20:30.909215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07166","last_updated":"2025-01-19T19:29:50Z","snapshot_observed_at":"2026-08-13T00:20:25.594179Z","submitted_at":"2024-10-09T17:59:00Z","title":"Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07166","snapshot_observed_at":"2026-08-12T00:20:30.930351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.930351Z"},"links":{"cited_paper":"/paper/2410.07166","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:b9c4f66549c6c84014e659b202ac875e0630c0d66eb2d87092a0ffa9aca66497","observation_id":"d6092662-97d3-483f-9352-65d6c435a8a9","resolution":{"observed_at":"2026-08-12T00:20:30.930351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09572","last_updated":"2025-04-22T17:56:22Z","snapshot_observed_at":"2026-08-14T20:53:01.569151Z","submitted_at":"2025-03-12T17:40:52Z","title":"Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09572","snapshot_observed_at":"2026-08-12T00:20:30.893043Z","title":"Lutfi Eren Erdogan, Nicholas Lee, Sehoon Kim, Suhong Moon, Hiroki Furuta, Gopala Krishna Anumanchipalli, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.893043Z"},"links":{"cited_paper":"/paper/2503.09572","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:77c6ca99cc2a7feb9d9c98eab7d4a2cd22b0ba37f0c6700bd125da57b5bd5d80","observation_id":"e5ec0b2d-640a-441c-8c8d-848892cd796c","resolution":{"observed_at":"2026-08-12T00:20:30.893043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T00:20:30.887706Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.887706Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:93628ab852c7c5d31bd8aebe698c9aba8b82c0bb5448b0ddb57ec31169a7913e","observation_id":"bf9020c1-d71a-4fc9-9863-446c487e5f0a","resolution":{"observed_at":"2026-08-12T00:20:30.887706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:18:11.351107Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.08255."}