{"as_of":"2026-08-08T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aec810c0b047f27543fea8b59d56346637045302668a2f0810b0ac29a5df0226","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:39:37.983121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:39:51.549262Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:a6f1fd15b8d9d72f9ed9f755f8b855a1f96a89cd2e3975953bb20c6639dd4a4e","observation_id":"2372b857-3786-4fdf-a12a-237a24cce147","resolution":{"observed_at":"2026-05-17T12:04:10.455408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:f515762639db250a6f7a0c85fc0fb24ca61042755f5675328552c045113aa7c5","observation_id":"8b5a8aa2-19e3-4392-a33e-eb36ad3f05c5","resolution":{"observed_at":"2026-05-15T21:20:59.461524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T18:39:37.983121Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-07T22:34:15.668776Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:37.983121Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:dc84bb88923e2f402f9db0ec21b9b26642fa85a4e4a8b6b112b261e1691262ff","observation_id":"11484c73-dde9-4c93-aa03-456ef3ded975","resolution":{"observed_at":"2026-08-07T18:39:37.983121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T13:52:59.670045Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:59.670045Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:550c4ce6fc9ff91fdcf82500595c3ef7709f6c6360615f40667a24055d90dc85","observation_id":"e5c53f99-5b8a-4238-9ef7-6295b93fd574","resolution":{"observed_at":"2026-08-07T13:52:59.670045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T13:24:30.408981Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21907","last_updated":"2025-05-31T04:48:02Z","snapshot_observed_at":"2026-08-07T13:17:19.145607Z","submitted_at":"2025-05-28T02:52:39Z","title":"Modeling and Optimizing User Preferences in AI Copilots: A Comprehensive Survey and Taxonomy","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:24:30.408981Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2505.21907"},"observation_digest":"sha256:d87d35bc041fd0a0833d069319c357a70fc2c792c69012a6383887027f9dc645","observation_id":"ac711189-9f6d-43d7-9184-727b8818fe3f","resolution":{"observed_at":"2026-08-07T13:24:30.408981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T12:09:00.985006Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.985006Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:c8d85068d854679dfde8dd43c04e7f03d4782f5d20881eaeffde9f5cb1a1e804","observation_id":"b389c14e-e26e-4d02-9c71-a9b0eadee153","resolution":{"observed_at":"2026-08-07T12:09:00.985006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T11:40:58.654310Z","title":"Archer: Training language model agents via hierarchical multi-turn rl, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-08-08T08:13:29.225328Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:58.654310Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.01716"},"observation_digest":"sha256:561b52c1dd0f537840b9ee60ec1bd03a6f056e6518e7712e7a339b44d879547f","observation_id":"fe81ee85-bce5-4ea0-9666-744b80f639c5","resolution":{"observed_at":"2026-08-07T11:40:58.654310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T11:32:30.549942Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-07T11:19:28.410568Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.549942Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:4440dbd6988870c22f3b0f0d09a70c0930773c502b4bc0c9f4f1bfe035c3ab68","observation_id":"f04a9702-4b69-44c0-ac3b-86915a75c762","resolution":{"observed_at":"2026-08-07T11:32:30.549942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T11:03:30.382349Z","title":"Find me double sided, machine washable decorative pillows with printing technology with size: 28","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04287","last_updated":"2025-06-20T03:16:30Z","snapshot_observed_at":"2026-08-07T22:33:30.380387Z","submitted_at":"2025-06-04T10:04:21Z","title":"Automated Skill Discovery for Language Agents through Exploration and Iterative Feedback","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:30.382349Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.04287"},"observation_digest":"sha256:bf8169385cb8f3ba4d28cfd2587bdb734049131e7928697f7886cdf75f7e74e6","observation_id":"630fbc79-01bf-4030-8d21-19eaea262789","resolution":{"observed_at":"2026-08-07T11:03:30.382349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T05:27:50.356815Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.356815Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:80415a9320200087e8d53023f9e39b0201494f2c143d23895260c5411f3fb1ea","observation_id":"e863c26d-93fc-486a-968c-e70c501dd59d","resolution":{"observed_at":"2026-08-07T05:27:50.356815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T04:39:39.085675Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-08T09:07:12.052492Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:39.085675Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.10406"},"observation_digest":"sha256:07976a443b1fa041cf25ddaadefa27e16909dc820ba53d249baaa7aaaf46fadb","observation_id":"42837901-c731-4b89-8ada-6a3b37bb2e11","resolution":{"observed_at":"2026-08-07T04:39:39.085675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T00:24:26.960285Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14448","last_updated":"2025-08-06T09:42:36Z","snapshot_observed_at":"2026-08-07T00:15:26.667463Z","submitted_at":"2025-06-17T12:13:56Z","title":"How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.960285Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.14448"},"observation_digest":"sha256:dff4c262a54f1af621d71d4ff8504966f41c31ce276c215c0e6f67d21ed710a3","observation_id":"0cfb8b71-f14a-44d6-b8f3-c7a381c3cc12","resolution":{"observed_at":"2026-08-07T00:24:26.960285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-06T16:14:04.049831Z","title":"Archer: Training language model agents via hierarchical multi-turn rl, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14295","last_updated":"2025-08-22T16:49:10Z","snapshot_observed_at":"2026-08-07T14:03:43.498386Z","submitted_at":"2025-07-18T18:07:38Z","title":"A Simple \"Try Again\" Can Elicit Multi-Turn LLM Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:14:04.049831Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2507.14295"},"observation_digest":"sha256:4d70c9bf308ac112e2004a4092679eaa5e854e2308c04ee1c84eba5b55b5fef8","observation_id":"6de5f99d-b149-450f-a171-fb3dcc223bb0","resolution":{"observed_at":"2026-08-06T16:14:04.049831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-05T23:55:51.017069Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04700","last_updated":"2025-08-12T15:11:53Z","snapshot_observed_at":"2026-08-07T09:56:01.664660Z","submitted_at":"2025-08-06T17:58:46Z","title":"SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T23:55:51.017069Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2508.04700"},"observation_digest":"sha256:dad99a5097c63138b5a31fbea2812596ae2b3417dfaf7547f95334e53927b34d","observation_id":"b1682c18-d074-4e3e-ac43-0408273afa93","resolution":{"observed_at":"2026-08-05T23:55:51.017069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-05T15:19:50.947042Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-08-05T15:19:32.265779Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:50.947042Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2508.20096"},"observation_digest":"sha256:e7894cad60341d31fe16f7be19ef6945b9e2f67d207bddf0e578f20ac75d31f5","observation_id":"535dcb56-38ea-4662-8ec2-dd8827cf14c3","resolution":{"observed_at":"2026-08-05T15:19:50.947042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-04T12:27:28.745515Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03520","last_updated":"2026-06-10T17:21:57Z","snapshot_observed_at":"2026-08-07T07:08:30.567791Z","submitted_at":"2025-10-03T21:24:41Z","title":"Certifiable Safe RLHF: Semantic Grounding and Fixed Penalty Constraint Optimization for Safer LLM Alignment","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T12:27:28.745515Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2510.03520"},"observation_digest":"sha256:ef3c6e52a0c9dd33f8e22c1dc478a5a92babc4c26df688960a4716cd140a44da","observation_id":"bc9e16b3-d475-4011-8cee-c3b82b527ec1","resolution":{"observed_at":"2026-08-04T12:27:28.745515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2510.13727","last_updated":"2026-05-19T04:39:26Z","snapshot_observed_at":"2026-08-02T19:37:00.796741Z","submitted_at":"2025-10-15T16:30:57Z","title":"From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T20:42:40.823721Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2510.13727"},"observation_digest":"sha256:42a90e6946553392b9fd673fa922a528f2bc2aacf6eda8c03e4e7218387e74cc","observation_id":"95e6a819-f23e-479c-a18a-da58ad239fed","resolution":{"observed_at":"2026-05-21T20:44:22.014508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.05413","last_updated":"2026-05-06T20:13:42Z","snapshot_observed_at":"2026-07-06T23:18:02.987518Z","submitted_at":"2026-05-06T20:13:42Z","title":"From History to State: Constant-Context Skill Learning for LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T16:50:43.547830Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.05413"},"observation_digest":"sha256:fc6781cac6c650ca4e3dbc69415ac81b10c99c7532dcaa1e771993188ee2f39a","observation_id":"46186c15-5bed-4455-bc3b-dccfdcf18c18","resolution":{"observed_at":"2026-05-11T18:01:05.529590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:95ddf16dba815950ff0a3a9e8b38fff807841f6ff5eee8d9d6777b9b1ae4b8cb","observation_id":"e1984de5-e929-4a2b-94e2-83467b69203e","resolution":{"observed_at":"2026-05-11T20:11:12.171337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-08T05:34:18.754195Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:082d6c642ab8c19134e77f40ab7d820f8dde20c6aba2284f7d75ff618828f8f9","observation_id":"830e555e-e74d-40ef-84fb-4290fa4652ad","resolution":{"observed_at":"2026-05-11T03:40:54.475555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-04T05:20:45.153287Z","title":"Archer: Training lan- guage model agents via hierarchical multi-turn rl, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-08T05:34:18.754195Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T05:20:45.153287Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:91f2ba0220a38730ac037b3004779323a042c9edce043fbcbcdeb66a1d7912fb","observation_id":"761b8ce8-90d4-4dfd-b99f-1e1288696ce0","resolution":{"observed_at":"2026-08-04T05:20:45.153287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-07T09:15:12.932880Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:751b4c65a7372d88fab5aa7c284c8817a4615298704ca83bd754e1da31cac4fb","observation_id":"4ac2a3c3-7399-4a83-aacd-b7eedd783c24","resolution":{"observed_at":"2026-05-20T05:38:05.483436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.22240","last_updated":"2026-06-03T09:01:29Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:46:25Z","title":"Unlocking Proactivity in Task-Oriented Dialogue","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:37.171422Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.22240"},"observation_digest":"sha256:7b16f721a79ef3c9e44a141b99eae3bbb72feb49aa84ed2dd6a6221b65dfff37","observation_id":"300a6290-65b5-4edd-8337-474164b0d212","resolution":{"observed_at":"2026-05-22T05:34:40.495072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.22240","last_updated":"2026-06-03T09:01:29Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:46:25Z","title":"Unlocking Proactivity in Task-Oriented Dialogue","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:11.074231Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.22240"},"observation_digest":"sha256:457d11794bc07630006d761257676e8320bb99776083d0cff0665ddb86b154ed","observation_id":"1d4d9da5-573f-441a-a56d-71f2d1ae5eec","resolution":{"observed_at":"2026-06-30T17:34:57.708669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2605.24517","last_updated":"2026-05-23T11:08:46Z","snapshot_observed_at":"2026-08-01T19:56:38.196339Z","submitted_at":"2026-05-23T11:08:46Z","title":"ECHO: Terminal Agents Learn World Models for Free","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T14:57:03.095107Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2605.24517"},"observation_digest":"sha256:1750b98dd81740c0a559e4ffcca9a7c96fe13e098e2d9e9f9d8e6bd5fdb755b7","observation_id":"a3d0c357-7b0e-47d6-ba3f-8aa4ff6a0155","resolution":{"observed_at":"2026-06-30T15:04:46.491807Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:d83443715ec96d41da1ff825284fe1f84ce768a66a6d98487369027aede17bc1","observation_id":"ecc25546-622a-4b51-95e1-5097794fe2d9","resolution":{"observed_at":"2026-07-01T20:46:14.296998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T14:33:00.408984Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2606.02355"},"observation_digest":"sha256:867501a1743eb8bf993cf3cae4d1dbabc4a5543d865cf7aa4ec9a1182af74986","observation_id":"e73b26fe-012c-41a7-8cf0-a8486627ae88","resolution":{"observed_at":"2026-07-01T23:16:23.950721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2606.05885","last_updated":"2026-06-04T08:54:09Z","snapshot_observed_at":"2026-08-08T00:56:45.958148Z","submitted_at":"2026-06-04T08:54:09Z","title":"When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T02:17:32.324432Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2606.05885"},"observation_digest":"sha256:b7255f2bdbd9b752627fd9868c3b230bdf391a114be9c2071fc90fbe1feeb8ca","observation_id":"d7de7e4d-e539-468c-b87b-9ffc62e5ab04","resolution":{"observed_at":"2026-07-02T12:16:56.932501Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":279,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:4a6085b1ff9b0124f8a22bde41be994aac5bbb72450d03b6e7c1572780a8860c","observation_id":"e4197b60-6ae7-4740-8e5a-28a05289d8a5","resolution":{"observed_at":"2026-07-04T08:09:40.601656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":"2402.19446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-04T13:39:51.549262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"97f343d2-478d-466c-8809-17815635cf6c","year":2024},"citing_paper":{"arxiv_id":"2606.26918","last_updated":"2026-06-25T11:53:41Z","snapshot_observed_at":"2026-08-07T14:15:31.695220Z","submitted_at":"2026-06-25T11:53:41Z","title":"Diagnosing Task Insensitivity in Language Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:11.929896Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2606.26918"},"observation_digest":"sha256:6a0b2830a37881e7e78ea3bb7e33064af4beb695dc3c67e0a75d852699166c53","observation_id":"0e1bac64-edce-4f51-a4c1-d4b607991b0a","resolution":{"observed_at":"2026-07-04T13:39:51.551580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprintarXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:50d1992fc9b707286a8f988ae91f5216deb47dd3bd2d57fd3611e0fa96bad5bd","observation_id":"6d680464-8def-4b55-8d3b-4975436da8a8","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-02T07:21:35.709395Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprintarXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:35.709395Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:6dfd950aaa218606ed43049fc70585fda17a5914208f2247ba324d16ff834385","observation_id":"ef2ce5bc-eb45-405c-aec1-288c1d48ea6b","resolution":{"observed_at":"2026-08-02T07:21:35.709395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-01T08:01:23.548585Z","title":"ArCHer: Training lan- guage model agents via hierarchical multi-turn RL.arXiv preprint arXiv:2402.19446,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21273","last_updated":"2026-08-04T10:37:25Z","snapshot_observed_at":"2026-08-07T23:11:42.684740Z","submitted_at":"2026-07-23T12:50:18Z","title":"The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:01:23.548585Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2607.21273"},"observation_digest":"sha256:da04e3304ee51ae0c7be2e9a87c4f77f29e283c503c6714006401ff9b068ce28","observation_id":"7d9fba77-4255-4205-b1ba-41b57be0a765","resolution":{"observed_at":"2026-08-01T08:01:23.548585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-01T06:17:30.221262Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21971","last_updated":"2026-07-24T04:35:29Z","snapshot_observed_at":"2026-08-08T03:29:18.543567Z","submitted_at":"2026-07-24T04:35:29Z","title":"Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T06:17:30.221262Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2607.21971"},"observation_digest":"sha256:8044973a062b342e4ad3b3c4f7a151b4019c838804f748987566889407b65e51","observation_id":"1d592169-b77b-4224-8570-132ba46210a4","resolution":{"observed_at":"2026-08-01T06:17:30.221262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-04T15:25:49.223723Z","title":"doi:10.48550/arXiv.2402.19446 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-08T22:10:57.699944Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T15:25:49.223723Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:da86e349c498ffdee40069e86f32bd74a54204d0cffa2286b32ff32f0ba47a31","observation_id":"028e7780-fa07-48ae-a71e-1085e1c681df","resolution":{"observed_at":"2026-08-04T15:25:49.223723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T00:15:15.761164Z","title":"doi:10.48550/arXiv.2402.19446 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-08T22:10:57.699944Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:15.761164Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:4bc44e461ab382faf6235f4628ad8c837bb894deedb8ae91f36b1b12f1893077","observation_id":"55ea2611-4fe6-4363-b476-5a5e49756d56","resolution":{"observed_at":"2026-08-07T00:15:15.761164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.19446/citation-record","integrity":"/paper/2402.19446/integrity","json":"/paper/2402.19446/citation-record.json","paper":"/paper/2402.19446"},"outbound":[],"paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2402.19446."}