{"as_of":"2026-08-10T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58ebe809e6f8a95ffb4930cb682962f6ab0ddc6c624364dbfbd6b51f3fa263cb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:25:49.165415Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:20:00.041093Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-08T11:25:49.165415Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07949","last_updated":"2025-05-20T19:54:36Z","snapshot_observed_at":"2026-08-09T00:37:18.281310Z","submitted_at":"2025-02-11T20:57:46Z","title":"Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T11:25:49.165415Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2502.07949"},"observation_digest":"sha256:e0c773ba13677c189b6460b05ad57a033cbf4f2186d10efb7833e256bca946d3","observation_id":"3d05642c-2028-4729-99d8-165576046229","resolution":{"observed_at":"2026-08-08T11:25:49.165415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2503.09572","last_updated":"2025-04-22T17:56:22Z","snapshot_observed_at":"2026-08-07T20:22:20.692339Z","submitted_at":"2025-03-12T17:40:52Z","title":"Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T21:32:18.491541Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2503.09572"},"observation_digest":"sha256:d1f643e121be516a29e00d296a84594c0bded0fd690662a43055d2a746b670cd","observation_id":"1a439e27-a856-4426-b5ad-49f735016f73","resolution":{"observed_at":"2026-05-17T21:32:18.628495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:29320f8b4be0ec927bec63a509b8b8ec2a7af26981e005a140b035eedf74da1c","observation_id":"8a08d509-760c-4940-bbdb-8350116a3a5f","resolution":{"observed_at":"2026-05-22T21:42:10.751909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T14:37:46.329762Z","title":"Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.329762Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:29ea0a9b3b9c89337e417f427d650f5e2a886b4c678f4fd54913bcb21d8dcad7","observation_id":"4efd62e6-4159-4d0d-b049-b694982913da","resolution":{"observed_at":"2026-08-07T14:37:46.329762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T14:12:02.794899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-08T09:25:43.689145Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:02.794899Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:861f8f856859b604ad5e900ff1c90e2b7d9c2b2d9f973f32ec97f5f69fd22d8d","observation_id":"c754b48f-8e54-47d5-923c-ac41bbb93d9f","resolution":{"observed_at":"2026-08-07T14:12:02.794899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T13:45:32.880275Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21055","last_updated":"2025-05-27T11:44:50Z","snapshot_observed_at":"2026-08-08T14:22:29.419644Z","submitted_at":"2025-05-27T11:44:50Z","title":"Agent-Environment Alignment via Automated Interface Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:32.880275Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.21055"},"observation_digest":"sha256:6b960fc2819742f72732732711294e33a6086ea6f67f9d948f1b559176d6dca2","observation_id":"84a7a678-435d-4764-9a4c-23ce173b09bc","resolution":{"observed_at":"2026-08-07T13:45:32.880275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T13:11:08.422497Z","title":"L.; Lai, H.; Sun, X.; Zhao, W.; Yang, Y.; Yang, X.; Sun, J.; Yao, S.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22368","last_updated":"2025-05-28T13:56:22Z","snapshot_observed_at":"2026-08-07T22:45:12.459152Z","submitted_at":"2025-05-28T13:56:22Z","title":"AgentDNS: A Root Domain Naming System for LLM Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:11:08.422497Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.22368"},"observation_digest":"sha256:ab0e72a46da564bd0bc4a54157fc62787bcb37f6d6fc7cb1bc3af9bd3302f966","observation_id":"f94e7756-8544-49e9-941d-b4d6cd891db6","resolution":{"observed_at":"2026-08-07T13:11:08.422497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T12:41:24.310946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23762","last_updated":"2025-05-29T17:59:51Z","snapshot_observed_at":"2026-08-08T14:02:10.449991Z","submitted_at":"2025-05-29T17:59:51Z","title":"ZeroGUI: Automating Online GUI Learning at Zero Human Cost","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:24.310946Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.23762"},"observation_digest":"sha256:1278630580ec71ea84e468f2d4c39c005c011737eb71318221cc09be7a8a09bf","observation_id":"767db96d-c03f-4295-8692-071b489e8168","resolution":{"observed_at":"2026-08-07T12:41:24.310946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T12:42:33.721752Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23885","last_updated":"2025-06-11T01:42:53Z","snapshot_observed_at":"2026-08-07T22:31:50.319614Z","submitted_at":"2025-05-29T17:51:58Z","title":"OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:33.721752Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.23885"},"observation_digest":"sha256:66a5cf140aedd5d3587d8cc3716bd3b75b3488feb622a593e54d7fa891842596","observation_id":"14a271ba-3cbd-410d-abf3-89156620648a","resolution":{"observed_at":"2026-08-07T12:42:33.721752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T11:40:36.060344Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-08-10T02:00:48.655191Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:36.060344Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.01716"},"observation_digest":"sha256:e7165ce202e6a16d9bfc652f5e8d454b96bf6863b4bed52e37759024faec7f3a","observation_id":"dcba1132-d734-494e-be0a-fc5a787f1ed5","resolution":{"observed_at":"2026-08-07T11:40:36.060344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2506.03610","last_updated":"2026-04-14T22:54:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T06:40:33Z","title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T12:01:42.681135Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.03610"},"observation_digest":"sha256:8074d243a53a9b8449ecd8f819e0a9f5cf76185601cc0297b951cdd0fc7bbdef","observation_id":"59ccd5d8-9b02-48c3-8bd2-ba65dad8f4ba","resolution":{"observed_at":"2026-05-19T12:02:16.716794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T10:28:21.810260Z","title":"L., Lai, H., Sun, X., Yang, X., Sun, J., Yang, Y., Yao, S., Zhang, T., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05109","last_updated":"2025-06-05T14:53:35Z","snapshot_observed_at":"2026-08-08T02:17:06.461305Z","submitted_at":"2025-06-05T14:53:35Z","title":"Truly Self-Improving Agents Require Intrinsic Metacognitive Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:28:21.810260Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.05109"},"observation_digest":"sha256:4a5efa5ee9766696b0dd79dcc1a7bc07f26f5d3f4aa9e8285163352937061ee4","observation_id":"7498d1e4-28c7-4c4e-bd30-e41f5108b9a1","resolution":{"observed_at":"2026-08-07T10:28:21.810260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T05:27:49.978039Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:49.978039Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:9639711abe978e10048c4aa332e529fd6e4b274ad2f18a3d0ea57af4b9bc05a2","observation_id":"2e782046-7782-462f-9b1e-06e866525791","resolution":{"observed_at":"2026-08-07T05:27:49.978039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T05:04:04.613379Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08972","last_updated":"2025-06-10T16:45:29Z","snapshot_observed_at":"2026-08-07T14:38:06.207367Z","submitted_at":"2025-06-10T16:45:29Z","title":"Atomic-to-Compositional Generalization for Mobile Agents with A New Benchmark and Scheduling System","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:04.613379Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.08972"},"observation_digest":"sha256:76674c55674746d493bbb07f251d8fb29912a5513bd49e3c719f19caae1ab3d5","observation_id":"23b686ae-f595-477c-a155-9ea064784556","resolution":{"observed_at":"2026-08-07T05:04:04.613379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T04:17:00.763378Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10953","last_updated":"2025-06-12T17:53:58Z","snapshot_observed_at":"2026-08-07T04:10:42.308014Z","submitted_at":"2025-06-12T17:53:58Z","title":"Build the web for agents, not agents for the web","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:17:00.763378Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.10953"},"observation_digest":"sha256:7ed6bcdc99c22cc03832cfe2ec0cc9fd95623715bf55c5013757f60fb6b43a06","observation_id":"584b1166-6f2e-4fa4-b163-63d343223acf","resolution":{"observed_at":"2026-08-07T04:17:00.763378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T04:16:08.504844Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning.ArXiv, abs/2411.02337, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-10T01:18:20.076393Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.504844Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:e855fb489983d99a3e043bd752cbd3c9ee273287416934c5510b47a163b9ec6f","observation_id":"e6aefe98-2f29-4ad0-b8e9-c6a42f5efe51","resolution":{"observed_at":"2026-08-07T04:16:08.504844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2506.15841","last_updated":"2025-07-17T08:53:48Z","snapshot_observed_at":"2026-08-04T10:58:41.179508Z","submitted_at":"2025-06-18T19:44:46Z","title":"MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:37.360221Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.15841"},"observation_digest":"sha256:915e0fb6ef6aef72e5c0a0e9aa4feeccb204fd905e72dbe5f07f5beae7e6417a","observation_id":"eea4fae6-f494-4e05-9c8d-05c761871989","resolution":{"observed_at":"2026-05-15T00:27:37.434374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-06T19:55:01.164687Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04370","last_updated":"2025-07-06T12:31:10Z","snapshot_observed_at":"2026-08-06T19:46:58.998645Z","submitted_at":"2025-07-06T12:31:10Z","title":"WebSynthesis: World-Model-Guided MCTS for Efficient WebUI-Trajectory Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:01.164687Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2507.04370"},"observation_digest":"sha256:36d6e091e36cd235b2b62c4a1a1cdde823874763d814c4194c8d4d5231a46169","observation_id":"4a1f1581-f669-4224-9f39-26e04b903bbc","resolution":{"observed_at":"2026-08-06T19:55:01.164687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:c896cc7fce50d0ab4b7ee7da8518de92851c420754bab3e66342e46d93a313d6","observation_id":"d5f4170c-1008-4f8d-881f-50d4d395223b","resolution":{"observed_at":"2026-05-14T22:23:15.489007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-05T23:55:50.893647Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04700","last_updated":"2025-08-12T15:11:53Z","snapshot_observed_at":"2026-08-09T20:49:03.329443Z","submitted_at":"2025-08-06T17:58:46Z","title":"SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T23:55:50.893647Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2508.04700"},"observation_digest":"sha256:74aa9a0864c3fd57d171f2769f56e48784b21b9f6e6c8da8cf1e85500f19c2b4","observation_id":"56fc05ce-ba75-47ee-88b3-2906e94b33b0","resolution":{"observed_at":"2026-08-05T23:55:50.893647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-05T23:36:21.986350Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05081","last_updated":"2025-08-07T07:05:22Z","snapshot_observed_at":"2026-08-05T23:36:16.102643Z","submitted_at":"2025-08-07T07:05:22Z","title":"Cognitive Duality for Adaptive Web Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:36:21.986350Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2508.05081"},"observation_digest":"sha256:376ce56c6b70eb81b19acdf4347f5232641d01d7e8edf5f8112de94d678fd7be","observation_id":"3420f575-8354-49a0-a0ac-002bd0281248","resolution":{"observed_at":"2026-08-05T23:36:21.986350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-05T21:01:24.747926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09586","last_updated":"2025-08-20T07:50:49Z","snapshot_observed_at":"2026-08-07T12:33:53.736485Z","submitted_at":"2025-08-13T07:59:29Z","title":"EvoCurr: Self-evolving Curriculum with Behavior Code Generation for Complex Decision-making","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:01:24.747926Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2508.09586"},"observation_digest":"sha256:aff9bb2b0200627eac1c90fceabce8f73f1bcf0b6691f044ac221da9b28e60a7","observation_id":"8ebe02db-d3f0-423e-8c0f-2cf95809e21e","resolution":{"observed_at":"2026-08-05T21:01:24.747926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-05T19:21:50.831536Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12800","last_updated":"2025-08-29T10:05:13Z","snapshot_observed_at":"2026-08-07T12:27:09.576328Z","submitted_at":"2025-08-18T10:23:10Z","title":"Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T19:21:50.831536Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2508.12800"},"observation_digest":"sha256:7f869ecb9e40e566e234bbe08d7ea74455fe99639be1f45d30aafb179db5e0bc","observation_id":"a32608b8-1845-430f-b8b0-6d33fa8819dd","resolution":{"observed_at":"2026-08-05T19:21:50.831536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-05T15:19:50.759166Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-08-09T15:33:57.613925Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:50.759166Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2508.20096"},"observation_digest":"sha256:5a6a433a831fc0e3fe76a0102f1611e6f6faed3b9d74147028eab161dde452e6","observation_id":"ceb3ec28-6bb5-463b-97f4-03a7fcc6ba6e","resolution":{"observed_at":"2026-08-05T15:19:50.759166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-05T05:34:10.896680Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05208","last_updated":"2026-08-07T05:48:38Z","snapshot_observed_at":"2026-08-10T02:09:05.377315Z","submitted_at":"2025-09-05T16:10:53Z","title":"Symbolic Graphics Programming with Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T05:34:10.896680Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2509.05208"},"observation_digest":"sha256:cecea4a73463467198414b4e538189dd4eed05dadefc4e4bfd2dea20265604a6","observation_id":"6841f209-0436-4463-aefc-e54ffc9774f9","resolution":{"observed_at":"2026-08-05T05:34:10.896680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-04T11:34:15.570579Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Rein- forcement Learning2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04033","last_updated":"2026-06-22T22:02:33Z","snapshot_observed_at":"2026-08-08T07:19:32.785815Z","submitted_at":"2025-10-05T04:52:26Z","title":"A global log for medical AI","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-04T11:34:15.570579Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2510.04033"},"observation_digest":"sha256:5c0bbb2fd54c92237c4e1754333f2f0afe78782de5063ed53279b78f6eb981b1","observation_id":"404606f8-a388-4e91-bd77-0ac751fe4792","resolution":{"observed_at":"2026-08-04T11:34:15.570579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-04T10:48:01.456515Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.456515Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:7062630eb0d7dbfe439e14c42934c7e00aa5131a5ac1a74dd139fe84d8934d5f","observation_id":"456f2f7e-ae95-44e5-9e90-486f0853b895","resolution":{"observed_at":"2026-08-04T10:48:01.456515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2510.13727","last_updated":"2026-05-19T04:39:26Z","snapshot_observed_at":"2026-08-02T19:37:00.796741Z","submitted_at":"2025-10-15T16:30:57Z","title":"From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T20:42:40.823721Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2510.13727"},"observation_digest":"sha256:098d8637ebfe7e6701f96c23fda516762b92a67a5e523c449a489d349661f4dc","observation_id":"3dd41f15-24e5-4f99-a39f-ff294db464cd","resolution":{"observed_at":"2026-05-21T20:44:22.018864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2511.15407","last_updated":"2026-05-24T06:09:04Z","snapshot_observed_at":"2026-08-03T21:29:28.726590Z","submitted_at":"2025-11-19T13:04:44Z","title":"IPR-1: Interactive Physical Reasoner","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:10.819298Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2511.15407"},"observation_digest":"sha256:7f876910b37e793382e4c4c33f342871aae4433c2ff2cd50ac6e2a0fe09d45f8","observation_id":"d6916505-eaec-47c5-8552-e8d1b831704b","resolution":{"observed_at":"2026-05-17T20:55:15.011939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-03T21:29:34.747408Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning.arXiv preprint arXiv:2411.02337, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15407","last_updated":"2026-05-24T06:09:04Z","snapshot_observed_at":"2026-08-03T21:29:28.726590Z","submitted_at":"2025-11-19T13:04:44Z","title":"IPR-1: Interactive Physical Reasoner","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T21:29:34.747408Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2511.15407"},"observation_digest":"sha256:4acfb13adf9f6818be9b5061b47cfbb9341761f107a04b2f491417af62f73419","observation_id":"52a3c39b-62df-47b7-9026-a1735bc6fb0e","resolution":{"observed_at":"2026-08-03T21:29:34.747408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2601.22149","last_updated":"2026-04-17T18:27:53Z","snapshot_observed_at":"2026-08-03T05:49:10.484175Z","submitted_at":"2026-01-29T18:59:07Z","title":"DynaWeb: Model-Based Reinforcement Learning of Web Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T09:33:30.444057Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2601.22149"},"observation_digest":"sha256:b79ca6e4b0eb4e80365b31d20095988c67920b0b151cf60dd35d046ce533abc8","observation_id":"59479678-5c43-4a1e-b726-d3dfcd61f296","resolution":{"observed_at":"2026-05-16T09:37:41.942922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-02T20:51:43.534953Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22190","last_updated":"2026-05-25T21:32:44Z","snapshot_observed_at":"2026-08-02T20:51:33.578240Z","submitted_at":"2026-02-25T18:34:57Z","title":"GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T20:51:43.534953Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2602.22190"},"observation_digest":"sha256:36aed5f95f7418f7bbd31f4806dad1fcdf7362b7e4e6c48f3e5385700948bb01","observation_id":"577a560a-e36c-4b7c-91b0-9fe6805dd2df","resolution":{"observed_at":"2026-08-02T20:51:43.534953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2603.23964","last_updated":"2026-04-13T08:15:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-25T05:56:54Z","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","version":2},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-05-15T01:20:03.181903Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2603.23964"},"observation_digest":"sha256:753a3d5efc395dedfaa904a72431364df1dad21ac35b70a77d8208f907f353c5","observation_id":"8b693a41-6a3b-4de6-9082-f74d0f1123f6","resolution":{"observed_at":"2026-05-15T01:23:27.237069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2604.06995","last_updated":"2026-05-30T06:36:32Z","snapshot_observed_at":"2026-08-01T11:15:54.583892Z","submitted_at":"2026-04-08T12:12:09Z","title":"What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:08.769264Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2604.06995"},"observation_digest":"sha256:c91aeaedf7bc8782a8e507916a61b51531302b80699527d383e93a135ec5319c","observation_id":"1b0603ab-9dfe-4f64-bc5d-bb4f5a41243e","resolution":{"observed_at":"2026-05-11T06:15:56.367208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2604.17989","last_updated":"2026-04-20T09:12:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:12:47Z","title":"AIT Academy: Cultivating the Complete Agent with a Confucian Three-Domain Curriculum","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:08:54.560648Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2604.17989"},"observation_digest":"sha256:7851faaa34863cdc6105976b372cc69ef499ad66d5d78eb791939a6fa4c0ec5e","observation_id":"79d01310-4cf2-4dc6-a202-fc8fec2f88f1","resolution":{"observed_at":"2026-05-10T09:43:49.877886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.00433","last_updated":"2026-05-01T06:10:03Z","snapshot_observed_at":"2026-08-02T09:02:27.121456Z","submitted_at":"2026-05-01T06:10:03Z","title":"Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T19:21:30.956682Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.00433"},"observation_digest":"sha256:102a5dace2b3d3a7ebf792608e049a0bb17142dabd10daa637f47ce60152531e","observation_id":"666a29e3-17d5-4c68-ad9e-ed837f4bdb64","resolution":{"observed_at":"2026-05-11T15:46:24.706366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:795f185d3bb5b61b9e35341c545c4732aba62824906df5d91ae92b02998d9256","observation_id":"f2208569-4677-4a3c-bb48-212c0babdade","resolution":{"observed_at":"2026-05-10T23:15:49.349693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.06078","last_updated":"2026-05-07T12:00:40Z","snapshot_observed_at":"2026-07-31T11:42:00.304740Z","submitted_at":"2026-05-07T12:00:40Z","title":"Milestone-Guided Policy Learning for Long-Horizon Language Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T10:50:40.760938Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.06078"},"observation_digest":"sha256:4baf396a48c050216d6544b89349dacba79d22f56de0889d6a57710cf1acecc2","observation_id":"e0674fe6-1e47-49fd-85ed-65a97b37eda1","resolution":{"observed_at":"2026-05-11T19:51:11.409606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.06761","last_updated":"2026-05-07T17:17:10Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:17:10Z","title":"Weblica: Scalable and Reproducible Training Environments for Visual Web Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:44.578007Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.06761"},"observation_digest":"sha256:ebd55e4defb349d8ea54fb5b788caaf643cce96cbf8b8d9a708f39bd412a6d08","observation_id":"058e9db2-225c-470b-902c-fa57a3760c99","resolution":{"observed_at":"2026-05-11T04:25:56.888142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-09T22:35:00.024991Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:9efd9fb8529c96bf7c67d61b0fbffb4ce813989c00681145f0ef990007c21a74","observation_id":"11ce60e9-4099-45ee-8ddb-43cd23bb6da5","resolution":{"observed_at":"2026-05-11T03:40:54.542352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-04T05:20:45.149642Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning.arXiv preprint arXiv:2411.02337, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-09T22:35:00.024991Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T05:20:45.149642Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:c2d1941b229c927d68145833211298fbf5b4064cb3bff9c6c68edba55efde874","observation_id":"61a65632-bb1d-4a68-a58d-f995578abf69","resolution":{"observed_at":"2026-08-04T05:20:45.149642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:44.087943Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:afec20da23795e5d99b1a707e29526585b2c10e2cf3e7319ae2a4443d011441c","observation_id":"0ed81619-69fc-4fd7-9a72-49183809b3a4","resolution":{"observed_at":"2026-05-12T06:21:26.500402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T21:30:42.766390Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:f90031b471360b648a02e0d90c825022ef37abd8a2fb6a0ecbf0b70728ea90c6","observation_id":"bd028f99-e4e3-48ac-b386-d6b57c581225","resolution":{"observed_at":"2026-05-14T21:32:59.620192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-07T09:15:12.932880Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:c59db949b2c9599bef056b5a57301177e80ef8b7d74947c56ab4f0ab5718d5db","observation_id":"b069b3c8-cb86-418f-94b9-e3117a4981e0","resolution":{"observed_at":"2026-05-20T05:38:05.549697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.20291","last_updated":"2026-05-26T02:53:26Z","snapshot_observed_at":"2026-08-02T08:40:10.058112Z","submitted_at":"2026-05-19T09:19:01Z","title":"Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-21T08:07:59.093519Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.20291"},"observation_digest":"sha256:2b868f285d393b9c224d69f77b644beadb53a5064923e8309f316a7d22814456","observation_id":"ed399df6-0832-4121-919d-a59193c3a5bc","resolution":{"observed_at":"2026-05-21T08:09:51.308730Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.20291","last_updated":"2026-05-26T02:53:26Z","snapshot_observed_at":"2026-08-02T08:40:10.058112Z","submitted_at":"2026-05-19T09:19:01Z","title":"Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:39:12.161639Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.20291"},"observation_digest":"sha256:0562e9f18dba7bab07f0f66473619fba0ba252d61c561f94e1c4a0b4faff17b9","observation_id":"c62bc5f8-cedb-4ae3-a1b4-4bcd212971a4","resolution":{"observed_at":"2026-06-30T19:15:01.478092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.21463","last_updated":"2026-05-20T17:51:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T17:51:05Z","title":"Mem-$\\pi$: Adaptive Memory through Learning When and What to Generate","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T04:27:25.041652Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.21463"},"observation_digest":"sha256:3e0fb757c63d6f0297bb1d12622083d2a35b41f530a72390808aa773537fa39e","observation_id":"6e5bcc9a-5671-4435-ad9f-e72c017169f0","resolution":{"observed_at":"2026-05-21T04:29:34.490134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.23939","last_updated":"2026-04-28T11:39:20Z","snapshot_observed_at":"2026-08-09T01:52:29.928061Z","submitted_at":"2026-04-28T11:39:20Z","title":"DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T09:01:22.412685Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.23939"},"observation_digest":"sha256:e0011adb9d7008e7182d7bb6e51a36d9cc9f721f439135ae10ea86dd30ac1f2d","observation_id":"6557edbf-7468-470d-a8f4-45441a6db87a","resolution":{"observed_at":"2026-07-01T09:05:36.639556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2605.27209","last_updated":"2026-05-26T16:02:00Z","snapshot_observed_at":"2026-08-03T11:00:10.339186Z","submitted_at":"2026-05-26T16:02:00Z","title":"Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T16:51:36.524194Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2605.27209"},"observation_digest":"sha256:10d4b68580159ec3318ebe83ef89c74f5d6aef47470f451972bb079041961e48","observation_id":"3d93c6be-e952-4002-9d0c-81f60346f689","resolution":{"observed_at":"2026-06-29T16:53:40.605741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-09T22:44:02.573653Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:ae18b2b38f1962d1b546c4f3e3dcaa906ddf6081f3215921248614ef69c80d68","observation_id":"9821d9a6-fad3-4048-a98a-743e8d7f257d","resolution":{"observed_at":"2026-06-28T17:22:25.262998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2606.09447","last_updated":"2026-06-08T12:55:42Z","snapshot_observed_at":"2026-07-06T23:48:48.962930Z","submitted_at":"2026-06-08T12:55:42Z","title":"AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T16:22:05.424293Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2606.09447"},"observation_digest":"sha256:8a8a462219da8a73b9472b344eefb23c55988eb86adb357c75d41ddb8460e6ab","observation_id":"abd50648-c9f2-4285-9a0d-9ff79f69f7f6","resolution":{"observed_at":"2026-07-03T01:47:31.170792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2606.12485","last_updated":"2026-06-10T08:56:27Z","snapshot_observed_at":"2026-07-06T23:51:22.219590Z","submitted_at":"2026-06-10T08:56:27Z","title":"Speculative Rollback Correction for Quality-Diverse Web Agent Imitation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T10:53:27.839408Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2606.12485"},"observation_digest":"sha256:f3afef08c150f43af253015ba2954b1ddd783e5c4998b10b5b24c67c12e72be3","observation_id":"9bcde929-0217-494a-ba96-38d72605a508","resolution":{"observed_at":"2026-07-03T08:17:45.241228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2606.21740","last_updated":"2026-06-19T20:53:10Z","snapshot_observed_at":"2026-08-01T23:24:43.869329Z","submitted_at":"2026-06-19T20:53:10Z","title":"Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T13:56:51.914966Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2606.21740"},"observation_digest":"sha256:ad0974d720d15133e8630594eac93a6cf5682fb5626f93ac2e5d017ebb0c873c","observation_id":"0ce9644d-fea6-4905-a03a-468dc6aaa1ec","resolution":{"observed_at":"2026-07-04T06:59:38.183304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.02337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-04T17:20:00.041093Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":"ceab60f7-8cb0-4202-b6d8-973b47e933fc","year":2025},"citing_paper":{"arxiv_id":"2606.24428","last_updated":"2026-06-23T11:05:05Z","snapshot_observed_at":"2026-08-05T04:36:12.703717Z","submitted_at":"2026-06-23T11:05:05Z","title":"Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-25T23:49:38.932474Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2606.24428"},"observation_digest":"sha256:e4372f019220db0480969c642faf6db8add165afb375bb848a7e42d3f914de43","observation_id":"8abca0e9-e8ab-472b-b5fc-d427f2488334","resolution":{"observed_at":"2026-07-04T17:20:00.042865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"WebRL: Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-06T23:48:50.589215Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:bbe149780d85de9cc6f9c396ce2a97eb16f66f28c4e77b235f46a3974e056a3d","observation_id":"18440b04-b9a5-4dea-b32d-f6f4e07bcc55","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-14T06:25:23.264527Z","title":"GPT-5.4 system card.https://openai.com/index/introducing-gpt-5-4/, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11185","last_updated":"2026-07-13T07:32:35Z","snapshot_observed_at":"2026-07-16T23:19:14.868685Z","submitted_at":"2026-07-13T07:32:35Z","title":"SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T06:25:23.264527Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2607.11185"},"observation_digest":"sha256:dc9ac2f0044d50548bc36beded7c38c68f6c855367d9f0602cef60a121865b1e","observation_id":"3ea66aef-dc4e-4898-8121-a7bf36a89eb6","resolution":{"observed_at":"2026-07-14T06:25:23.264527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-31T02:18:01.764481Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-08-06T17:55:59Z","snapshot_observed_at":"2026-08-09T23:12:22.871674Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.764481Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:7790f3274052ffd4746e7a8654383a510d9d1280699b9327f9cb3074d1694b81","observation_id":"258eb65e-660f-489a-ac9d-68331475c65b","resolution":{"observed_at":"2026-07-31T02:18:01.764481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-04T23:05:27.962904Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01678","last_updated":"2026-08-03T04:14:59Z","snapshot_observed_at":"2026-08-07T11:35:10.108951Z","submitted_at":"2026-08-03T04:14:59Z","title":"Progressive Agent Skill Generation via Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T23:05:27.962904Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2608.01678"},"observation_digest":"sha256:17fb1f1748c03ccd91ef5ecef7a947b8b663b8d66aa98a79527fe95abe456c10","observation_id":"2ea62fda-50e5-4f86-b47c-1711cdedaf18","resolution":{"observed_at":"2026-08-04T23:05:27.962904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.02337/citation-record","integrity":"/paper/2411.02337/integrity","json":"/paper/2411.02337/citation-record.json","paper":"/paper/2411.02337"},"outbound":[],"paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 58 inbound Pith citation observations for arXiv:2411.02337."}