{"as_of":"2026-08-11T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c2ebcae6403945f05ac03136f23d5c3179adf1c21ba310ba6a4ba7075589d14","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:55:00.149522Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22724/citation-record","integrity":"/paper/2607.22724/integrity","json":"/paper/2607.22724/citation-record.json","paper":"/paper/2607.22724"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T11:54:56.943572Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:56.943572Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:4c929cdfacb70cbd18c958488887adbfb5c9ce4aab9f2f41703c56b2125c184d","observation_id":"735f858a-003b-4482-bfb6-99bf523fe866","resolution":{"observed_at":"2026-08-01T11:54:56.943572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.024936Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.024936Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:f255bd9037c3e79fcc605c2dbb6d5bcd42af51ede2ee76069b46c1bd2d24e292","observation_id":"153f6762-c155-4940-a48f-5abfbc6c7910","resolution":{"observed_at":"2026-08-01T11:54:57.024936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-08-04T11:11:09.166918Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.06672","snapshot_observed_at":"2026-08-01T11:54:57.104603Z","title":"Xrpo: Pushing the limits of grpo with targeted exploration and exploitation.arXiv preprint arXiv:2510.06672, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.104603Z"},"links":{"cited_paper":"/paper/2510.06672","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:4540291aa67b41f7c2e541e3d3979415e47ba5aaef93db4eec54eb6615ff4d96","observation_id":"76b916fa-ceae-4a1f-8c33-6bc7d40bfe1e","resolution":{"observed_at":"2026-08-01T11:54:57.104603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.183813Z","title":"Progra: Progress-aware reinforcement learning for multi-turn function calling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.183813Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:d8b35d1b6ebe753a1ffa4b5600c686bd59b95b589719ad79e623fd068edce828","observation_id":"d1c681c6-96d6-4772-8643-d084061965fb","resolution":{"observed_at":"2026-08-01T11:54:57.183813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26684","last_updated":"2026-06-01T06:20:12Z","snapshot_observed_at":"2026-08-03T17:58:37.045292Z","submitted_at":"2026-05-26T08:23:34Z","title":"Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26684","snapshot_observed_at":"2026-08-01T11:54:57.260816Z","title":"Beyond trajectory-level attribution: Graph-based credit assignment for agentic reinforcement learning.arXiv preprint arXiv:2605.26684, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.260816Z"},"links":{"cited_paper":"/paper/2605.26684","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:4147ca6bf75f652d754f4a6ff6575296bae682112c24e1131927b7708b0451d4","observation_id":"e9d9387e-8aa1-4762-8e92-2eabf8b75da1","resolution":{"observed_at":"2026-08-01T11:54:57.260816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.347969Z","title":"Proximity-based multi-turn optimization: Practical credit assignment for llm agent training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.347969Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:1cdb714dfd4dcdc3b5b9eefd9374ef31e9bfab6ffac5cb1fe3e5ad142bc80ece","observation_id":"f39d3ef5-e163-4ba1-8e85-655eb5f7fe63","resolution":{"observed_at":"2026-08-01T11:54:57.347969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.387214Z","title":"Towards efficient online tuning of VLM agents via counterfactual soft reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.387214Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:e17be3bd2544aa543a7a5639cdda4c828d637cc01555d6afb9319d09012ef573","observation_id":"8b5ce984-ba5e-45cd-9070-d08ec0e81ae5","resolution":{"observed_at":"2026-08-01T11:54:57.387214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.408564Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.408564Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:ca606e0f19feefb695ccdda1917cdcc08306904694d7ba8e6464f6eb3eaa0b3f","observation_id":"2aecaa62-a666-492c-9d25-c4c1980a138c","resolution":{"observed_at":"2026-08-01T11:54:57.408564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.449494Z","title":"Multimodal web navigation with instruction-finetuned foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.449494Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:fb1db0142da0f7f3e8f65adc16d994e04e972f4383a1c9b6490957b47c72da62","observation_id":"29d00fd5-e39d-4257-bf65-eec4519cf6a8","resolution":{"observed_at":"2026-08-01T11:54:57.449494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.482108Z","title":"Navigating the digital world as humans do: Universal visual grounding for GUI agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.482108Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:7ad6f637e94261dbfd5cf3d07bc63ff3b318f4aa4dac981f70ac5303d834dfcf","observation_id":"7b74b658-d362-43e5-8bd8-2e99cd0f9c94","resolution":{"observed_at":"2026-08-01T11:54:57.482108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.550878Z","title":"Hierarchy-of-groups policy optimization for long-horizon agentic tasks.arXiv preprint arXiv:2602.22817, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.550878Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:5286ce4f64f1cf3c26390f8a655f76dd5ad8e29e31cc0f381e08737c2a90df26","observation_id":"e70a9ec2-8237-4ecc-b7f4-4c2831afcfe5","resolution":{"observed_at":"2026-08-01T11:54:57.550878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.627348Z","title":"Buy 4 reinforce samples, get a baseline for free! InICLR 2019 Workshop, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.627348Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:a0d6e97b48194b7ed397d07fae8cde10a2049382aa287a4f404d796dc89c35a6","observation_id":"3066127f-4654-4345-9d09-bfd39d4d3d11","resolution":{"observed_at":"2026-08-01T11:54:57.627348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.697039Z","title":"No prompt left behind: Exploiting zero-variance prompts in llm reinforcement learning via entropy-guided advantage shaping.arXiv preprint arXiv:2509.21880, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.697039Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:95c2e5e6bf1978ffd74433cfce2bbab5f7672cbfaf174c8ee39bae151e53e679","observation_id":"9bec2e20-02f0-4da2-b05f-5ebdf58e5339","resolution":{"observed_at":"2026-08-01T11:54:57.697039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.763485Z","title":"Salt: Step-level advantage assignment for long-horizon agents via trajectory graph","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.763485Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:91b0ff9f2d22811fa1171bf43c1b192febbb111e1e0c5df23f681f016f146b5b","observation_id":"ba852e80-66cd-4988-bddb-7dbc2b450f2d","resolution":{"observed_at":"2026-08-01T11:54:57.763485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:57.849466Z","title":"Embodied agent interface: Benchmarking LLMs for embodied decision making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:57.849466Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:170b5b10bde38e7e74848cc8c7507665211d81ed85a1c4ab1f203d8906b1ccfc","observation_id":"1bb46914-ba17-471c-8a21-b66cb2d554d0","resolution":{"observed_at":"2026-08-01T11:54:57.849466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:58.026598Z","title":"Agentic reinforcement learning with implicit step rewards.arXiv preprint arXiv:2509.19199, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.026598Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:1a69d3977e5e5e261326b34dbb5572d26e2d34b1f3e7c6c197e07a40a9e673ad","observation_id":"b694f3a2-2a2b-40ea-ae60-66a4cd8aaa80","resolution":{"observed_at":"2026-08-01T11:54:58.026598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-01T11:54:58.149883Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.149883Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:43994c4cc1028710606aace108e41b65831dc5a085ca81765bd6d9e0c69b48f0","observation_id":"6f170e07-8301-4bc9-a2e3-116956eb6366","resolution":{"observed_at":"2026-08-01T11:54:58.149883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22776","last_updated":"2026-04-06T08:29:58Z","snapshot_observed_at":"2026-07-06T22:43:41.372821Z","submitted_at":"2026-01-30T09:58:45Z","title":"TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22776","snapshot_observed_at":"2026-08-01T11:54:58.217966Z","title":"Tspo: Breaking the double homogenization dilemma in multi-turn search policy optimization.arXiv preprint arXiv:2601.22776, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.217966Z"},"links":{"cited_paper":"/paper/2601.22776","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:219ce2864e9cfc7026472812d106e75185b51c900350b72ee8a53c6aa848e9a0","observation_id":"9ef6eb7f-41df-451c-bf4e-00675be94ffe","resolution":{"observed_at":"2026-08-01T11:54:58.217966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:58.321856Z","title":"Ngrpo: Negative-enhanced group relative policy optimization.arXiv preprint arXiv:2509.18851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.321856Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:df75158807506b0eefd9b5a727501b42d9c178f1da04fffe695fed5d1eb8cdb1","observation_id":"c0ed8ad7-bd09-4dbd-9a3b-bcb972e39b69","resolution":{"observed_at":"2026-08-01T11:54:58.321856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-01T11:54:58.370351Z","title":"ToolRL: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.370351Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:3d852a1598e6d419669f2759995f9e18ffdc71d7a42e60e9396411d4cf1d5c45","observation_id":"ab76c4dc-079a-47a8-ae20-a36978d09223","resolution":{"observed_at":"2026-08-01T11:54:58.370351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12292","last_updated":"2020-02-29T16:12:58Z","snapshot_observed_at":"2026-08-10T22:27:45.925100Z","submitted_at":"2020-02-27T18:03:16Z","title":"RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12292","snapshot_observed_at":"2026-08-01T11:54:58.489272Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments.arXiv preprint arXiv:2002.12292, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.489272Z"},"links":{"cited_paper":"/paper/2002.12292","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:f39d282e9cac9d0d0876a2cb7d4ea9860da954790b3e112ed0fc99bf76530ca8","observation_id":"e39b4dfb-3766-4988-bd8f-80d31b93802a","resolution":{"observed_at":"2026-08-01T11:54:58.489272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:58.558728Z","title":"Toolformer: Language models can teach themselves to use tools.Advances in Neural Information Processing Systems, 36:68539–68551, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.558728Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:5bf745d6388167aa80aa289841d0c66d467672f59c62a4130382c966f188b423","observation_id":"c6c5daa6-733f-4db9-b1b4-450f2e84d886","resolution":{"observed_at":"2026-08-01T11:54:58.558728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T11:54:58.628083Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.628083Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:7f5be05f2a79bc80c7b2dc87095a28fc08a2c6394630046374ab32c788b0bbcd","observation_id":"fb84fd38-1f30-4ad0-b912-50e749c4a27f","resolution":{"observed_at":"2026-08-01T11:54:58.628083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T11:54:58.733456Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.733456Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:ba7418b495ed4256bd84dcd67146e3e8c54a3fc7977c544adbd0c449a59c657b","observation_id":"fd73ad1f-60b7-4a24-9f29-5a0e76208184","resolution":{"observed_at":"2026-08-01T11:54:58.733456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:58.902231Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.902231Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:5696082227b0c94bb0b2e91c6c81f0581a17c2cba82785ed180f3ea88dbe3309","observation_id":"a1464195-bee3-40ab-a24e-ce74a2e37d8e","resolution":{"observed_at":"2026-08-01T11:54:58.902231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:58.960233Z","title":"ALFWorld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:58.960233Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:11a205b04d2056f045279cefc39731b14f358a06cee0465254dc7d790916533d","observation_id":"d56febe0-c7b2-4e16-a94f-834d91a6effd","resolution":{"observed_at":"2026-08-01T11:54:58.960233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-01T11:54:59.062582Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.062582Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:093b5273b403e382bcd7c9ed34348a9b554fc674a74b10161f9311488ac87d87","observation_id":"1add1d35-3663-46e3-8b31-dd1718c77724","resolution":{"observed_at":"2026-08-01T11:54:59.062582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-01T11:54:59.123594Z","title":"Kimi k1.5: Scaling reinforcement learning with LLMs.arXiv preprint arXiv:2501.12599, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.123594Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:b27a57aca4891d02a60a320be640cb9511125f6ce8b74af211adfd66ab928bfb","observation_id":"12cecd86-58dc-47f0-a82d-cf3ee377e031","resolution":{"observed_at":"2026-08-01T11:54:59.123594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:59.187480Z","title":"Voyager: An open-ended embodied agent with large language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.187480Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:3eca722dd3c9ba4151a3f03b5248e13598aa1d289daab2c27d3b25dc44b7ad30","observation_id":"77f84b04-9d40-491f-9927-52328a607635","resolution":{"observed_at":"2026-08-01T11:54:59.187480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:59.299303Z","title":"Information gain-based policy optimization: A simple and effective approach for multi-turn llm agents.arXiv preprint arXiv:2510.14967, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.299303Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:48ef35739cc605b16a06fac346983c4309eeaf0ae5519fe438c371920a8dcb45","observation_id":"0c3f1976-d2f5-4aa9-8e5e-ea3e347b890e","resolution":{"observed_at":"2026-08-01T11:54:59.299303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-01T11:54:59.427547Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution.arXiv preprint arXiv:2505.20732, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.427547Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:94ed4ab21f4c3c1c63a5712c90e58ce53d6afd04cadfc7ad8348dfc7c26013b2","observation_id":"69741546-e41a-4506-a1df-59b33b37d407","resolution":{"observed_at":"2026-08-01T11:54:59.427547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:59.487844Z","title":"Mobile-Agent-v2: Mobile device operation assistant with effective navigation via multi-agent collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.487844Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:6de3f9d1210a8dc2531a6c6b5eae9ac1cdfb1e93e38dc3db461035d804199f42","observation_id":"8aa4bd78-cbee-4d74-a401-bcde75c7ef8e","resolution":{"observed_at":"2026-08-01T11:54:59.487844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-01T11:54:59.568773Z","title":"SWE-RL: Advancing llm reasoning via reinforcement learning on open software evolution.arXiv preprint arXiv:2502.18449, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.568773Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:3315994e2750ef52330ed64cf34e54acb6e607b5fd6563bd82e3ac50ade99e39","observation_id":"e6f8b6a3-ab00-49c3-9543-10dd64968821","resolution":{"observed_at":"2026-08-01T11:54:59.568773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:59.658025Z","title":"Agentprm: Process reward models for llm agents via step-wise promise and progress","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.658025Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:199f8de7e2d887e6bdd2b0b811e930a63148b32b733b25d1e53eb38227b524de","observation_id":"ede04870-efde-46f5-84f5-1c473f846b00","resolution":{"observed_at":"2026-08-01T11:54:59.658025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:59.719592Z","title":"Watch every step! llm agent learning via iterative step-level process refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.719592Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:4ed80e08b03d92216a9336ddaf68a2a42238b8dd0759b8ee10455ed5cba8ac00","observation_id":"16f0f686-765a-471b-bf93-1715f5ea85ce","resolution":{"observed_at":"2026-08-01T11:54:59.719592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T11:54:59.787781Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.787781Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:7eb64952c88bd86e164da75c53c47cd52a79dc0174e09c58cd8c4ab07ef205b7","observation_id":"051548c4-99fd-47c1-af84-d6ed190263df","resolution":{"observed_at":"2026-08-01T11:54:59.787781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:54:59.916475Z","title":"WebShop: Towards scalable real-world web interaction with grounded language agents.Advances in Neural Information Processing Systems, 35:20744–20757, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.916475Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:71dcb048dc78e8425d02dd46b5bfceb43de345d9c702e7398e17746a15f65b1d","observation_id":"388bfc90-99b3-45cb-9700-2c87a312a1fe","resolution":{"observed_at":"2026-08-01T11:54:59.916475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-01T11:54:59.962766Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.962766Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:0f0174e4c13947a642304ddeb7f47c8b47cbf805d2583ffee77efaaa25c8e024","observation_id":"0c24956e-6f6d-4016-b592-9e6a32c08b93","resolution":{"observed_at":"2026-08-01T11:54:59.962766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T11:55:00.025273Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:00.025273Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:78e797f3d6c697543e792a4cfa961a61107e702c04a2e7a778fceebee061352c","observation_id":"0ce797b9-649e-4872-ab75-2f4d50c414a2","resolution":{"observed_at":"2026-08-01T11:55:00.025273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:00.080830Z","title":"Reinforcement world model learning for llm-based agents.arXiv preprint arXiv:2602.05842, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:00.080830Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:1300cbac0e09726fee298e9fe1ff5bc51921e141bbd0d0d57a229cde98106eac","observation_id":"f7c6c403-0bc4-426d-9a67-637a11b4e003","resolution":{"observed_at":"2026-08-01T11:55:00.080830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:00.117534Z","title":"Scaf-grpo: Scaffolded group relative policy optimization for enhancing llm reasoning.arXiv preprint arXiv:2510.19807, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:00.117534Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:1d934308f9549fb27ebd5f75afaadeab4894c053e34bc725f022a0af99b1749a","observation_id":"89303a57-3d4e-45c8-8f9d-684a626ada19","resolution":{"observed_at":"2026-08-01T11:55:00.117534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:00.149522Z","title":"put a cool tomato on the countertop","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:00.149522Z"},"links":{"citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:e0b7b7ab2dcc076d328477eacfb3e346f9e57c0e71f37ab9e5d9cdd3d11dac1d","observation_id":"7081ea75-5803-4eca-ad0f-75a2a6116586","resolution":{"observed_at":"2026-08-01T11:55:00.149522Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T10:57:39.589450Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2607.22724."}