{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb23e7f3d99100dbe0f42dca230650da19fb3c98637c95091364920a3264d0dc","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:07:10.796768Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:25:14.276099Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.408321Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-08-06T19:25:14.276099Z","title":"Arpo: End-to-end policy opti- mization for gui agents with experience replay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05720","last_updated":"2025-07-08T07:07:53Z","snapshot_observed_at":"2026-08-07T22:33:02.019770Z","submitted_at":"2025-07-08T07:07:53Z","title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:14.276099Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2507.05720"},"observation_digest":"sha256:dfe5aa7b16a4eddc6ef350fb41cc455e7604a6b380672620471f33416432c662","observation_id":"c7df2476-8c0a-48d9-8a9f-2cf60b09acd7","resolution":{"observed_at":"2026-08-06T19:25:14.276099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-08-05T09:41:26.544360Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T10:13:58.774968Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2509.02544"},"observation_digest":"sha256:cac0ecb57372ab7fb26f6c2164f193f8bd1ac7a078a769b5708557afe71fd4db","observation_id":"efa7606d-90a1-4c89-a24d-f755e76324f5","resolution":{"observed_at":"2026-05-13T10:13:59.047730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-08-04T12:52:27.271355Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01833","last_updated":"2026-05-25T18:23:42Z","snapshot_observed_at":"2026-08-04T12:52:24.589866Z","submitted_at":"2025-10-02T09:28:13Z","title":"Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:52:27.271355Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2510.01833"},"observation_digest":"sha256:e5f0dd275eefec2d6c45a51933fc779cb97c5b2a2df42e5d9e970a7d481728f1","observation_id":"0acd32bd-456b-4de0-87eb-b50696880523","resolution":{"observed_at":"2026-08-04T12:52:27.271355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-08-03T16:30:39.322149Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13278","last_updated":"2026-06-05T03:56:56Z","snapshot_observed_at":"2026-08-06T12:37:47.631212Z","submitted_at":"2025-12-15T12:38:04Z","title":"AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T16:30:39.322149Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2512.13278"},"observation_digest":"sha256:a09a41c674e71f5239d02bef8bf7ec3846de494b789cd66cbbda6c109fdc1e3a","observation_id":"61c88db6-3fd5-4294-852b-ee3cc6395ca1","resolution":{"observed_at":"2026-08-03T16:30:39.322149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:d5e13012464d66f9d6186bb1b74c49080a5030c04ac34c8ecc13cd5af27c53d2","observation_id":"f7a6fa83-59c1-42f8-bd82-ecc76dcd26e5","resolution":{"observed_at":"2026-05-17T15:14:25.866371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2604.09574","last_updated":"2026-02-24T04:29:42Z","snapshot_observed_at":"2026-08-05T05:08:09.074150Z","submitted_at":"2026-02-24T04:29:42Z","title":"Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T20:35:17.075890Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2604.09574"},"observation_digest":"sha256:93a89081a9eadcfef9c424404d779500b95e77df6b993c3b8d5b9a572e6fe70a","observation_id":"a00a8d54-94c6-4eff-8a4b-afedab8048e3","resolution":{"observed_at":"2026-05-15T20:36:35.212903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2605.01208","last_updated":"2026-05-02T02:54:36Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T02:54:36Z","title":"Faithful Mobile GUI Agents with Guided Advantage Estimator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T15:17:05.477466Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2605.01208"},"observation_digest":"sha256:b05c3fa75b35cde3ebe17f7efda610e16cc1843b3fa27065aa38298a802aaaf6","observation_id":"32ddfcb8-f0f4-4f19-ad06-b0543b4f3018","resolution":{"observed_at":"2026-05-11T16:41:24.147115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2605.02572","last_updated":"2026-05-04T13:25:05Z","snapshot_observed_at":"2026-07-06T23:15:37.099197Z","submitted_at":"2026-05-04T13:25:05Z","title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-08T18:13:25.735085Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2605.02572"},"observation_digest":"sha256:ff511a792a774ff99b062019be38af0e9108968498703484a4acbe4a9e13ae20","observation_id":"3ab69e72-872e-4417-b40f-66d6b72ad9eb","resolution":{"observed_at":"2026-05-09T06:40:40.641959Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2605.08978","last_updated":"2026-05-12T02:23:49Z","snapshot_observed_at":"2026-08-09T20:33:45.175189Z","submitted_at":"2026-05-09T14:44:18Z","title":"Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T03:00:01.549385Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2605.08978"},"observation_digest":"sha256:c273b8d927f88d1b2576a89ef55f0c61e64b11aea98b87bd46a9dd4d342f95d2","observation_id":"61a0ea97-88b7-4880-83e2-222fca09fa1a","resolution":{"observed_at":"2026-05-12T03:01:17.873771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2605.08978","last_updated":"2026-05-12T02:23:49Z","snapshot_observed_at":"2026-08-09T20:33:45.175189Z","submitted_at":"2026-05-09T14:44:18Z","title":"Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T00:58:25.205386Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2605.08978"},"observation_digest":"sha256:df9bcd609a3cafc04a3d296d5d1d3fb7ab9fb6f36ede0c456212f56007dec883","observation_id":"e43a52a5-801e-44c0-a4e7-1f00e7d6cdf0","resolution":{"observed_at":"2026-05-13T02:17:07.683646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2605.12481","last_updated":"2026-05-12T17:57:04Z","snapshot_observed_at":"2026-08-09T08:12:42.231591Z","submitted_at":"2026-05-12T17:57:04Z","title":"ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T03:51:54.401200Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2605.12481"},"observation_digest":"sha256:6504ff90cc5d2a7a7d909db7409613ad5a5a3c3712059390ba66c4239eeb8398","observation_id":"494b1bdb-c798-4aa8-b384-8e948dd3bd4f","resolution":{"observed_at":"2026-05-13T03:52:12.365420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:441b5387081e210b39b40b1a59daeb126481c582111151e19e21d4c4bc89272f","observation_id":"ad7335ec-cd17-4d1b-85cc-f1e71fcfc475","resolution":{"observed_at":"2026-07-01T21:16:13.369302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2606.07027","last_updated":"2026-06-05T08:17:28Z","snapshot_observed_at":"2026-08-01T08:01:00.499508Z","submitted_at":"2026-06-05T08:17:28Z","title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T22:24:41.353303Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2606.07027"},"observation_digest":"sha256:3a3c96d347130d252eabcb840e4ec533b8cdac804858ceb2e19f2fe3c1c49199","observation_id":"44daa594-25cc-420c-a599-f689908c2cdb","resolution":{"observed_at":"2026-07-02T16:47:09.594291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:2a2fcb351a04c8a92971a3909beec1af76795581e2a7e1edcefcfb1905de84f4","observation_id":"46e7f937-ef14-4065-9ae5-ae9c9c4aa368","resolution":{"observed_at":"2026-07-04T08:09:40.731617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2606.25451","last_updated":"2026-06-24T06:26:34Z","snapshot_observed_at":"2026-08-08T09:11:59.283080Z","submitted_at":"2026-06-24T06:26:34Z","title":"Learning with a Single Rollout via Monte Carlo Pass@k Critic","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-25T20:53:10.016447Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2606.25451"},"observation_digest":"sha256:f5997e2ee6c91f3b62b7f41eff864df52d3188caef6709bce1443c05c5f05403","observation_id":"3450fa5e-24d1-467e-99a6-dbf7f0c44049","resolution":{"observed_at":"2026-07-04T20:00:08.409789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"cited_work":{"arxiv_id":"2505.16282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16282","snapshot_observed_at":"2026-07-04T20:00:08.408321Z","title":"Arpo: End-to-end policy optimization for gui agents with experience replay","venue":null,"work_id":"80d8a156-5ad4-40ba-8380-ceee5ef6bb17","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2505.16282","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:5ae97051fb2f435a5db4277596c34518cc135ded0fcc308f5c8aadddbaa9eed3","observation_id":"490492e7-74a4-411e-afa8-b66bcd8c2a8d","resolution":{"observed_at":"2026-06-29T12:53:26.532661Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16282/citation-record","integrity":"/paper/2505.16282/integrity","json":"/paper/2505.16282/citation-record.json","paper":"/paper/2505.16282"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:07:08.732949Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.732949Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:e4bbd0df63bce0d5d05945c65759559fbf1fe80e630231a23da0b7f95e5e0e39","observation_id":"a97a4621-6c2e-4838-8b44-aac68c14df56","resolution":{"observed_at":"2026-08-07T15:07:08.732949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-07T15:07:08.818285Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.818285Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:9c97c58438726c91d49fd4e506a3f9ed712b39f58361925415219fa76d0ec93f","observation_id":"a5544cf9-7703-4840-aa66-c648472154de","resolution":{"observed_at":"2026-08-07T15:07:08.818285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T15:07:08.943210Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:08.943210Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:ade066215694bd476dd240f57956b937add60004583e75c233e0cba40ebcd854","observation_id":"06a674f1-8a7e-48ab-8c65-6f05654887e2","resolution":{"observed_at":"2026-08-07T15:07:08.943210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-07T15:07:09.054423Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.054423Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:c101ef3fd53ce5189fc0090653d3914b437ffef9c66dcfe61ecc365b6161916d","observation_id":"a204acfe-dfc4-4120-a7ae-98cec497d88e","resolution":{"observed_at":"2026-08-07T15:07:09.054423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:07:09.148499Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.148499Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:ad392618aee69f0b094965b465fcbe77ccc40213aa94ac698d9da59fc03a5ba6","observation_id":"96a71639-ea78-4543-8235-922a76b611cc","resolution":{"observed_at":"2026-08-07T15:07:09.148499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.405649Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"cad9f083-53f9-4210-8a6b-cecd78d460c4","year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.257984Z"},"links":{"citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:1f768dc34339f361636d629db43916e0ca29fa9fb467aa19e3afc3c767c7cb6f","observation_id":"f2923ec7-65ca-4e66-a110-9ab98fa6804c","resolution":{"observed_at":"2026-08-07T15:07:11.440915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T15:07:09.358618Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.358618Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:dae5370fba9e7e25cf6ebb09b06123dfa3d97a92852e8cd4bed1cf78c136062f","observation_id":"08626187-7624-473a-848e-7420015aef08","resolution":{"observed_at":"2026-08-07T15:07:09.358618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:07:09.452790Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.452790Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:aba0e41df4db41797de69a66e912f1c5b0ff42a22643bac1fa0bf72f2240a92d","observation_id":"48d13b54-9277-4d20-9f3b-7d8563c4eae4","resolution":{"observed_at":"2026-08-07T15:07:09.452790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17553","last_updated":"2024-07-21T23:16:13Z","snapshot_observed_at":"2026-07-06T17:36:16.016176Z","submitted_at":"2024-02-27T14:47:53Z","title":"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17553","snapshot_observed_at":"2026-08-07T15:07:09.526745Z","title":"Omniact: A dataset and benchmark for enabling multimodal generalist autonomous agents for desktop and web","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.526745Z"},"links":{"cited_paper":"/paper/2402.17553","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:4a1a771f92f438b576080784bcff090521cc631e4204892234c2f26f65a233a6","observation_id":"4b5481a0-74d7-401d-881c-9dac23cee2e4","resolution":{"observed_at":"2026-08-07T15:07:09.526745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.333861Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"0244b1a0-5dd0-4087-90b2-165960087f8d","year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.645013Z"},"links":{"citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:f93fc76de398b2fe722a232c5bc1e1ff81418a37f5f5b722c7b05e648892e11b","observation_id":"e0a72d0c-1f2b-439e-b76a-0815a1f77501","resolution":{"observed_at":"2026-08-07T15:07:11.374189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:09.737013Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.737013Z"},"links":{"citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:deedebdf74bc61a928d87727df431771be0e02024fdd32eb3d40f854e3c85665","observation_id":"723a7e63-be07-4902-9360-6ab11888e498","resolution":{"observed_at":"2026-08-07T15:07:09.737013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T15:07:09.853262Z","title":"Seg-zero: Reasoning- chain guided segmentation via cognitive reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.853262Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:489ab11928ba3c7fb2452c311b2d53a11c02d95b3dc5e6f2a55f79e268904593","observation_id":"8ea43a1d-8027-47f5-b596-6acbc00c0eb8","resolution":{"observed_at":"2026-08-07T15:07:09.853262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:07:09.981894Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:09.981894Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:54107d6d77cc1631b6ae89773e52b34db7cb533931c239e266138084a2f627cf","observation_id":"bc7d8539-4150-48cb-832c-6b4548dd2e82","resolution":{"observed_at":"2026-08-07T15:07:09.981894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07945","last_updated":"2024-02-09T02:33:45Z","snapshot_observed_at":"2026-08-09T18:18:05.552918Z","submitted_at":"2024-02-09T02:33:45Z","title":"ScreenAgent: A Vision Language Model-driven Computer Control Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07945","snapshot_observed_at":"2026-08-07T15:07:10.028219Z","title":"Screenagent: A vision language model-driven computer control agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.028219Z"},"links":{"cited_paper":"/paper/2402.07945","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:29b94d2510dba544dfa34adb6e6bb9965c2cc76277bd9fd6327c31db10c8e6c3","observation_id":"2a897a41-6265-4c2c-abd7-a4289024e73f","resolution":{"observed_at":"2026-08-07T15:07:10.028219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T15:07:10.067180Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.067180Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:49f11719fd5a6b0ca49a36dbda500bb149d49a78787af7024ab56d45dad9cf8e","observation_id":"53b21184-ee19-4e15-a7de-b8d3d4fa34d7","resolution":{"observed_at":"2026-08-07T15:07:10.067180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T15:07:10.120332Z","title":"Ui-tars: Pioneering automated gui interaction with native agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.120332Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:c309c6839d858fc93cc2d5b2981d90469a095f4e732e84701ca1f4eb2a8b7706","observation_id":"202e5032-e30c-4814-905a-6ed48af0b141","resolution":{"observed_at":"2026-08-07T15:07:10.120332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.242980Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"46f86b3f-13ea-4733-ad7e-9266221bdcf9","year":2023},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.174192Z"},"links":{"citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:4d20f968363cb8efd6df6804de0a75c4b568396498841fdbdfb54328a2f87f40","observation_id":"15b11a46-da31-4f47-aea5-c4c68fc8cadd","resolution":{"observed_at":"2026-08-07T15:07:11.288367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:07:10.211575Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.211575Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:260b21e2d4ad9b6930097f1a9814ae1bc46deee12048be5a36a179f6aba25415","observation_id":"1f8adde8-ef64-4dfe-a2b9-59b519a037ef","resolution":{"observed_at":"2026-08-07T15:07:10.211575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:07:10.279353Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.279353Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:af7b129d777dbe437c5c95ed5d9e48a02c94ec6354129b439a780f702f390eeb","observation_id":"1d28fa66-0dad-4959-9ec7-efc2a223b9c2","resolution":{"observed_at":"2026-08-07T15:07:10.279353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:07:10.332778Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.332778Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:f4e89dc87d27ea0d182ed6e6c46dd73410e027d81447c33966a64c79a0cc1c5d","observation_id":"440ba8ab-3650-4f73-bf52-0b10af21267c","resolution":{"observed_at":"2026-08-07T15:07:10.332778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-10T06:52:44.809057Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T15:07:10.363216Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.363216Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:39e5ea216ce3d059915f0bf1fef42ef8212c5d3dc2d891b3184c0c7e4a40d36a","observation_id":"6ababca5-5736-47a2-924b-fd00f9d5b887","resolution":{"observed_at":"2026-08-07T15:07:10.363216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.172536Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"66636e06-3044-4579-87a7-2e15dcb8df98","year":2022},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.403817Z"},"links":{"citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:3bac1c2e06d96b206d855fdfcd3ceb97e2e4b3ac5fd792cc103acec11b96daa7","observation_id":"eda3ee73-fe85-4711-a4cc-bec481c35515","resolution":{"observed_at":"2026-08-07T15:07:11.194077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-07T15:07:10.444576Z","title":"Os-atlas: A foundation action model for generalist gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.444576Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:5b420492faea3b4e52576b6367e407e0d05e68ff8c20362c94177b61226d67a7","observation_id":"8f180272-3fd7-41f7-af45-ed5731c23050","resolution":{"observed_at":"2026-08-07T15:07:10.444576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T15:07:10.491309Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.491309Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:4f0c8a97bb7f9f0e67fa34ff0c7b5736e42f847041eb68e61fc241a288405a0f","observation_id":"58f4df80-56d4-438d-8f34-5af8fc91a67a","resolution":{"observed_at":"2026-08-07T15:07:10.491309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:07:11.101193Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"b1b9520b-e327-463b-ac45-48d0aaad048b","year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.537390Z"},"links":{"citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:53b062e0e824c7b764c24f68ab4449975a0fd641b556b9aae298c271e0d50865","observation_id":"f4d6f9ea-76b2-4537-a06c-9ecfa4747bd3","resolution":{"observed_at":"2026-08-07T15:07:11.128405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-07T15:07:10.588099Z","title":"Aguvis: Unified pure vision agents for autonomous gui interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.588099Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:4a95063c07b697739ced2142d271e3b4409315a4cdcd266768f627110c4bbc86","observation_id":"ca674936-63b4-4926-aa11-f4c6420fc5b6","resolution":{"observed_at":"2026-08-07T15:07:10.588099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16256","last_updated":"2025-07-08T08:49:17Z","snapshot_observed_at":"2026-08-07T14:52:21.966604Z","submitted_at":"2024-12-20T07:16:57Z","title":"Aria-UI: Visual Grounding for GUI Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16256","snapshot_observed_at":"2026-08-07T15:07:10.649086Z","title":"Aria-ui: Visual grounding for gui instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.649086Z"},"links":{"cited_paper":"/paper/2412.16256","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:2ae49967c234d843a4c054b09811d07bfead1e359f0c3af33ea27f23e0584892","observation_id":"a363f308-e927-4e0c-9fbf-e202d39c717e","resolution":{"observed_at":"2026-08-07T15:07:10.649086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:07:10.758735Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.758735Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:617f9a74ee44a57b638f476b007b5f5844075f48afe2025e39e1eb9f4f481af2","observation_id":"f9423a99-3bc6-4f52-a8cb-ee85a07db547","resolution":{"observed_at":"2026-08-07T15:07:10.758735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T15:07:10.796768Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:10.796768Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.16282"},"observation_digest":"sha256:6d4f9c4ceb4ae95c3822bb546875cf82104ea5cbd2f7c8a9cc52bd92017cd1ce","observation_id":"b169f929-fb11-4c83-8be7-a284473d8032","resolution":{"observed_at":"2026-08-07T15:07:10.796768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16282","last_updated":"2025-05-22T06:24:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:08:58.661516Z","submitted_at":"2025-05-22T06:24:32Z","title":"ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 16 inbound Pith citation observations for arXiv:2505.16282."}