{"as_of":"2026-08-10T05:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:261a079d61b50463c5d2378496a87931e5b1868b3dff5e57b1f0f8a80a35883c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:49.267563Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:26:37.281563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:47:09.687885Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2604.02345","last_updated":"2026-02-11T17:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T17:02:38Z","title":"UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T02:59:27.807789Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2604.02345"},"observation_digest":"sha256:c4ed83e1fd97164764d1a78c44da7eb7a543c63c126edfb037a244fcb9c60518","observation_id":"32164952-9169-4ee7-af71-03c15a4fad7f","resolution":{"observed_at":"2026-05-16T03:00:31.666131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2604.27955","last_updated":"2026-04-30T14:51:49Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:51:49Z","title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-07T05:48:00.486572Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2604.27955"},"observation_digest":"sha256:2f2def03cbe34de63e576b3f5f06bf95f1c3a54afc6bcca98597a6a81140eeb6","observation_id":"81223177-eb8d-47d6-92ed-1976515667bf","resolution":{"observed_at":"2026-05-12T10:31:29.615649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2605.07110","last_updated":"2026-05-08T01:38:46Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:38:46Z","title":"Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:19.239355Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2605.07110"},"observation_digest":"sha256:3469f5e233da40b74749c7e5ebbd33693e170298ccbff23e3de64624d8dfdef9","observation_id":"331eab4f-af11-4384-8355-7588e38095c9","resolution":{"observed_at":"2026-05-11T04:35:56.866360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-08-10T02:33:45.391037Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T19:26:37.281563Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2606.00564"},"observation_digest":"sha256:b61965ae55b32e002f763b1ebf67d407cf932a0c06437e0fca8502d10953286f","observation_id":"106cf729-2ff8-4143-ace8-1a0164978cba","resolution":{"observed_at":"2026-06-28T19:32:35.010485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2606.07027","last_updated":"2026-06-05T08:17:28Z","snapshot_observed_at":"2026-08-01T08:01:00.499508Z","submitted_at":"2026-06-05T08:17:28Z","title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T22:24:41.353303Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2606.07027"},"observation_digest":"sha256:d57c8cce0785fd196376d110a5ed9a95383782124c8f423b241a686ef5b86125","observation_id":"6c8feefd-d674-4c20-a654-fa417d286531","resolution":{"observed_at":"2026-07-02T16:47:09.689614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18121/citation-record","integrity":"/paper/2505.18121/integrity","json":"/paper/2505.18121/citation-record.json","paper":"/paper/2505.18121"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.878920Z","title":"Digi-q: Learning vlm q-value functions for training device-control agents","venue":null,"work_id":"a658979a-3353-48aa-9fac-3eb95b147e7f","year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.129305Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:a2ab4882c11b5004927409c3c98a4b05a074c091818fda2678eea6ecef13fc42","observation_id":"aec7cd57-76d8-4c11-a7ff-73119782bc71","resolution":{"observed_at":"2026-08-07T14:37:51.949072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.694147Z","title":"Digirl: Training in-the-wild device-control agents with autonomous re- inforcement learning","venue":null,"work_id":"7ea9065e-acd7-427c-bdf9-e62f511b2a0b","year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.198300Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:8ce0c5e2b7c200e58aab9cfb8d436518690b96abcd17d3ef19cb4d898b9c094a","observation_id":"f7254977-e58d-4cd0-abab-2582825f887b","resolution":{"observed_at":"2026-08-07T14:37:51.762133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.495042Z","title":"Learning about progress from experts","venue":null,"work_id":"c5338dbe-6a41-4f3f-9388-36363c5e9675","year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.251487Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:67cfb4cd4e7d250a71b92780089688a15f1d4e3b7e57f08631f01cab682a81bb","observation_id":"a5895103-8609-41bb-847b-5452b5004258","resolution":{"observed_at":"2026-08-07T14:37:51.581616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:37:45.337260Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.337260Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:2532a175ae7746aa216a2758db2b070d70d7cac4a67f0462b288b359534f6df0","observation_id":"879f22e9-00ab-40d8-9a23-badacf93344a","resolution":{"observed_at":"2026-08-07T14:37:45.337260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:37:45.419221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.419221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:586b2fe9b8d8505adee04898c8b781c24bff335872703896dfa3eafabbae8e5b","observation_id":"53605823-cbb5-4d82-80f2-6a76092eb65e","resolution":{"observed_at":"2026-08-07T14:37:45.419221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.290045Z","title":"Dungeons and data: A large-scale nethack dataset","venue":null,"work_id":"bb44dbd8-1f56-46c3-9e55-a34a49e22b98","year":2022},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.508048Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:129da2a37f8971992cc7c5d03f06a3a8edad9df41cfe42a81e7fe8b5857a9bb2","observation_id":"9bb8ec98-2eac-4dc7-8c12-73a5d9dd3a60","resolution":{"observed_at":"2026-08-07T14:37:51.400251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T14:37:45.597283Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.597283Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:0e3ff30d75dcb79e10f4bf64b6bc44dc7622342c01fceeebf9092244fe6e8091","observation_id":"e7dc26f3-39d4-42cb-91c6-261d8a91c241","resolution":{"observed_at":"2026-08-07T14:37:45.597283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-07T22:33:31.452435Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"cited_work":{"arxiv_id":"2504.13145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13145","snapshot_observed_at":"2026-08-07T14:37:49.973211Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","venue":"cs.AI","work_id":"6fe2cedd-07b9-4e33-8452-69b2b355170c","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.644348Z"},"links":{"cited_paper":"/paper/2504.13145","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:6e51d6c747f4cedf9adcc2d1c5fe114c3e1a5cb9585bb01f3a29cfb9388a6ce9","observation_id":"58e481f7-a907-4cbb-9051-e260b61b71d4","resolution":{"observed_at":"2026-08-07T14:37:50.068075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.740939Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.740939Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:6cbac5a1b391fd1ba95d78c0f1bb894b50b74759cc2df2d1b0e1d2f69b22d487","observation_id":"a4ae53f1-e8c2-4bcc-ac12-def7e240e590","resolution":{"observed_at":"2026-08-07T14:37:45.740939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.786546Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.786546Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c4543de146eba0d72d3fa8d94c466f7371905e673f6fad953238cbdc397cc8ab","observation_id":"8b426dbb-a6d4-449f-b9d5-68468ac898a7","resolution":{"observed_at":"2026-08-07T14:37:45.786546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-07T14:37:45.862230Z","title":"UI-R1: enhancing action prediction of GUI agents by reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.862230Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:92d0dbf1ba16c5d3eadaaa8aa3350ce8c5ce2581fc7743e8961f0b2e9bbe5682","observation_id":"4a6e6515-a8a4-4cac-a2c8-9cca2eecd7b2","resolution":{"observed_at":"2026-08-07T14:37:45.862230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02907","last_updated":"2025-02-05T18:56:51Z","snapshot_observed_at":"2026-07-06T19:27:20.458797Z","submitted_at":"2024-10-03T18:56:51Z","title":"NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02907","snapshot_observed_at":"2026-08-07T14:37:45.943894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.943894Z"},"links":{"cited_paper":"/paper/2410.02907","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d6cd60fd8fba4a09f86cac418146857a8b007b0ea618e92cb930035e3635d2fc","observation_id":"50f6f860-4632-4c42-8826-d133a6404fdb","resolution":{"observed_at":"2026-08-07T14:37:45.943894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.114137Z","title":"Xu, Aman Madaan, Jiarui Liu, Robert Lo, Abishek Sridhar, Sudipta Sengupta, Dan Roth, Graham Neubig, and Shuyan Zhou","venue":null,"work_id":"7700eff7-f345-4def-b8ba-546211cddd23","year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.013705Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d2c3781f3d0907f88474a6de7a04b752202122dd9d9dec248c1e4a73c6c201b9","observation_id":"47146464-9f0a-4fd5-8d7f-bafd72db849c","resolution":{"observed_at":"2026-08-07T14:37:51.202532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11357","last_updated":"2025-05-30T02:30:57Z","snapshot_observed_at":"2026-08-07T18:13:59.301597Z","submitted_at":"2025-02-17T02:13:48Z","title":"Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11357","snapshot_observed_at":"2026-08-07T14:37:46.119179Z","title":"Explorer: Scaling exploration-driven web trajectory synthesis for multimodal web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.119179Z"},"links":{"cited_paper":"/paper/2502.11357","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c858264c5c05e372c2a5ef2adf0e656a84082bb06e76cd916bf43f3d8cdf022e","observation_id":"f3f932b9-fe28-43b6-9684-dfa389c944ac","resolution":{"observed_at":"2026-08-07T14:37:46.119179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-03T07:29:21.763809Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-07T14:37:46.228152Z","title":"Au- tonomous evaluation and refinement of digital agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.228152Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c0064e2ecc740f08f3b35ab51ffe467d2a88b965fdd06cfec308631d61a934fa","observation_id":"b5b3b549-039f-4284-99eb-97810c3fe91c","resolution":{"observed_at":"2026-08-07T14:37:46.228152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-08-09T19:59:05.212319Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T14:37:46.329762Z","title":"Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.329762Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:29ea0a9b3b9c89337e417f427d650f5e2a886b4c678f4fd54913bcb21d8dcad7","observation_id":"4efd62e6-4159-4d0d-b049-b694982913da","resolution":{"observed_at":"2026-08-07T14:37:46.329762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T14:37:46.431629Z","title":"UI-TARS: pioneering automated GUI interaction with native agents.CoRR, abs/2501.12326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.431629Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:44fa367f782a63df03bf208ba2bfcf05b47f17dad803b391e2d665d2d1091290","observation_id":"8e89bd61-c05a-4608-9851-7de29189cb15","resolution":{"observed_at":"2026-08-07T14:37:46.431629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T14:37:46.502834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.502834Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:2ef84a309889a970b4e48150b705f169387e3cb80980f6407ec7cba5fa94a083","observation_id":"18d80b30-3761-4e5e-b55e-c5e36827d8ce","resolution":{"observed_at":"2026-08-07T14:37:46.502834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.910869Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":"bdeedbfb-6199-4684-a3dd-49796641a25a","year":2019},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.642165Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:797cb1cc96879fc07e55b4e80fbad939becd2f92b70ff544b047e45809aac57d","observation_id":"d4bdfdd7-bfd0-451a-a2a5-ffbd21fb45d1","resolution":{"observed_at":"2026-08-07T14:37:51.001358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.720401Z","title":"Step: Stacked llm policies for web actions","venue":null,"work_id":"2239b7e1-de5f-4fad-94a8-e592ca212ada","year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.921764Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:25d752e338a8d8f205bc2dcc66bab0b3fdc883afba9d830730fda8331f9677db","observation_id":"c464d765-6783-4c58-ba4f-a10440cdcbe1","resolution":{"observed_at":"2026-08-07T14:37:50.788218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T14:37:47.033881Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.033881Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:e49533c50450c8e66f526d8ab215c30035689c438506d1de20800e117c731709","observation_id":"c9cf3a05-12da-493e-98f2-dce10c1ab90d","resolution":{"observed_at":"2026-08-07T14:37:47.033881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10893","last_updated":"2025-01-18T22:34:41Z","snapshot_observed_at":"2026-08-08T03:48:52.006507Z","submitted_at":"2025-01-18T22:34:41Z","title":"Learn-by-interact: A Data-Centric Framework for Self-Adaptive Agents in Realistic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10893","snapshot_observed_at":"2026-08-07T14:37:47.108403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.108403Z"},"links":{"cited_paper":"/paper/2501.10893","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:221d3f215c02d28a07f27ad691b15297c68adb59ea87c54cee05bd9f2e981afd","observation_id":"3eb32102-56d0-490f-a9e5-92e377d9949e","resolution":{"observed_at":"2026-08-07T14:37:47.108403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19723","last_updated":"2025-06-27T08:25:48Z","snapshot_observed_at":"2026-08-07T22:32:37.258577Z","submitted_at":"2024-12-27T16:21:58Z","title":"OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19723","snapshot_observed_at":"2026-08-07T14:37:47.185783Z","title":"Os-genesis: Automating GUI agent trajectory construction via reverse task synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.185783Z"},"links":{"cited_paper":"/paper/2412.19723","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:88b84a2cf67bcba38274275acfcdad3ffcd986d89a19115a2948b60678dd648b","observation_id":"486f8fcf-9f3c-4375-be1f-f7656a1a18bf","resolution":{"observed_at":"2026-08-07T14:37:47.185783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T14:37:47.238146Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.238146Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:46c271a1aa53a87fbb60d28d341232d4b180a2e77710c32733a7c3e3355ad2c1","observation_id":"c6421f46-7dfa-4f7a-8464-a8c8d1c8b002","resolution":{"observed_at":"2026-08-07T14:37:47.238146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.380315Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.380315Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:666449c7b407ad892ec4e28a6deb42e519a18bf2e4fa9f228acf81b4ecd8236e","observation_id":"19a62709-4c66-4c0c-b607-d22e1aa6c55a","resolution":{"observed_at":"2026-08-07T14:37:47.380315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14803","last_updated":"2025-02-21T16:23:59Z","snapshot_observed_at":"2026-07-06T19:36:15.200874Z","submitted_at":"2024-10-18T18:19:56Z","title":"DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14803","snapshot_observed_at":"2026-08-07T14:37:47.485240Z","title":"Distrl: An asynchronous distributed reinforcement learning framework for on-device control agents.CoRR, abs/2410.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.485240Z"},"links":{"cited_paper":"/paper/2410.14803","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:660cfb125ee8fc9730caedeb865fa261071761b56eedec9db5727c456821404d","observation_id":"053bc850-e181-465d-8960-9813e0b5f08f","resolution":{"observed_at":"2026-08-07T14:37:47.485240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15821","last_updated":"2024-05-23T14:01:44Z","snapshot_observed_at":"2026-07-06T18:19:33.945119Z","submitted_at":"2024-05-23T14:01:44Z","title":"Reinforcing Language Agents via Policy Optimization with Action Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15821","snapshot_observed_at":"2026-08-07T14:37:47.590688Z","title":"Reinforcing language agents via policy optimization with action decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.590688Z"},"links":{"cited_paper":"/paper/2405.15821","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:1363d784923d1c80bd7cf7914aa3035cbf03638cb485aa24abe2ff476894cc00","observation_id":"8029fb17-4eaa-44da-a0b9-37a8b23ba8c9","resolution":{"observed_at":"2026-08-07T14:37:47.590688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T14:37:47.700415Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.700415Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:feebc882a6e18e7d2e31ef474b2c59707f0ec47be4ae279d9aee47ca0d4cdcd4","observation_id":"a3e49663-2092-4537-8873-2260e3312495","resolution":{"observed_at":"2026-08-07T14:37:47.700415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T14:37:47.804784Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.804784Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c38c67edf64905ad352f54dc1ea43d101354555e3c1d38c041c56012a0346baf","observation_id":"19c05f48-6249-4353-acce-6092cd98e096","resolution":{"observed_at":"2026-08-07T14:37:47.804784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-07T14:37:47.937341Z","title":"Aguvis: Unified pure vision agents for autonomous GUI interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.937341Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:26e66544c41a7d134baad15e1be9d0eae444e8c9c15396c3cc178c25af7760f0","observation_id":"5a6a36ef-b5cf-4007-84c6-d943abba95e4","resolution":{"observed_at":"2026-08-07T14:37:47.937341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.641631Z","title":"Agenttrek: Agent trajectory synthesis via guiding replay with web tutorials","venue":null,"work_id":"53e85318-087c-4da1-a090-003183969369","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.039904Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:dc07f6c9a9c10ed0d1133ddec6a10548a6e930a672c722444354183223da82a5","observation_id":"835c7d55-3d95-4219-9486-da9488b80267","resolution":{"observed_at":"2026-08-07T14:37:50.672358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:37:48.119240Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.119240Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:a407e6a69f08078d260634510563a1950baa078e5142c32fc4b0f5f5e58ecca2","observation_id":"3450faf6-7e13-4dc7-8f4e-c5518ff85d63","resolution":{"observed_at":"2026-08-07T14:37:48.119240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09724","last_updated":"2024-04-01T13:50:51Z","snapshot_observed_at":"2026-08-07T05:06:51.002209Z","submitted_at":"2023-11-16T09:56:28Z","title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09724","snapshot_observed_at":"2026-08-07T14:37:48.213972Z","title":"Outcome-supervised verifiers for planning in mathematical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.213972Z"},"links":{"cited_paper":"/paper/2311.09724","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:bb5cf1b70102e69e4fd651c13f7f8cf9925ac74b63e88a9208413ab5e5804021","observation_id":"bd0674c3-a3c1-4f74-af92-f26678f2827c","resolution":{"observed_at":"2026-08-07T14:37:48.213972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-10T02:01:09.632053Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-07T14:37:48.320653Z","title":"Free process rewards without process labels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.320653Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:23a6cd54e28d72854e5a0f70145525a67e5b2a8e362f67ed01782924bc7fbf13","observation_id":"750b3d33-83c5-4606-8ed4-199bcbfa0d59","resolution":{"observed_at":"2026-08-07T14:37:48.320653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-09T09:54:10.798330Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-07T14:37:48.529789Z","title":"UFO: A ui-focused agent for windows OS interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.529789Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:1ae9b4d0a87e0a246c7653e4d70be80402cbb079eba90775ff40f0dd8cff08eb","observation_id":"5dc867a9-8a39-4ef1-ae06-9424c5cdf5d8","resolution":{"observed_at":"2026-08-07T14:37:48.529789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.664282Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.664282Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:2d5dd9b36dfacd5d491c6199db1e26efac32c9acbd9828ce7b09cdaeaf6e3a40","observation_id":"8db64b3d-63b0-47ef-b6ef-d92909160a9a","resolution":{"observed_at":"2026-08-07T14:37:48.664282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.437074Z","title":"Large language models are semi-parametric reinforcement learning agents","venue":null,"work_id":"6b6991eb-b342-468a-aee9-88c2bb778024","year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.771877Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:fea7a0b5547414f9aa31c33ad689342fdc06ef970fc8b63e48ae6ee66852976b","observation_id":"d601e41c-ad3e-4be6-92fe-9e5ad8d03326","resolution":{"observed_at":"2026-08-07T14:37:50.549721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08144","last_updated":"2024-06-13T11:51:37Z","snapshot_observed_at":"2026-07-06T15:26:58.583640Z","submitted_at":"2023-05-14T12:31:03Z","title":"Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08144","snapshot_observed_at":"2026-08-07T14:37:48.872226Z","title":"Mobile-env: Building qualified evaluation benchmarks for llm-gui interaction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.872226Z"},"links":{"cited_paper":"/paper/2305.08144","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:ef71707a4c838b169d90737bf2378f4bdd8769e7e5a63ebb544654b3061721d4","observation_id":"32ad9c9e-7ec1-40c1-99e7-bdf899b9763d","resolution":{"observed_at":"2026-08-07T14:37:48.872226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T14:37:48.959454Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.959454Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:cd4938360ed9e71dfdbd5f90235865197939a34b9cd0a39f495a6ea213901e83","observation_id":"129c17e0-bb24-4cf3-ad7e-bbdcd6ef5525","resolution":{"observed_at":"2026-08-07T14:37:48.959454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.318538Z","title":"Gpt-4v(ision) is a generalist web agent, if grounded","venue":null,"work_id":"cc79f59c-378a-461b-8e86-0d241a5adcd6","year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.041108Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:f5af6cdc772d7387468cf1ebb604576ff4a286e8ab8ed9b60082f239009b3b6f","observation_id":"a0dee5fd-9a2b-44d8-a18e-b0cb28957dc1","resolution":{"observed_at":"2026-08-07T14:37:50.386446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18906","last_updated":"2025-02-26T07:52:02Z","snapshot_observed_at":"2026-08-07T17:47:52.710195Z","submitted_at":"2025-02-26T07:52:02Z","title":"VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18906","snapshot_observed_at":"2026-08-07T14:37:49.160588Z","title":"VEM: environment-free exploration for training GUI agent with value environment model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.160588Z"},"links":{"cited_paper":"/paper/2502.18906","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d524cbe4a8faf0e20dc70278535444e9b88a11ffe8e532533263e3a7a4f58147","observation_id":"54802348-9e11-49bd-a93e-166b08e21376","resolution":{"observed_at":"2026-08-07T14:37:49.160588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13194","last_updated":"2024-12-17T18:59:50Z","snapshot_observed_at":"2026-08-03T11:34:22.888935Z","submitted_at":"2024-12-17T18:59:50Z","title":"Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13194","snapshot_observed_at":"2026-08-07T14:37:49.207033Z","title":"Proposer-agent-evaluator(pae): Autonomous skill discovery for foundation model internet agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.207033Z"},"links":{"cited_paper":"/paper/2412.13194","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d919a79d953f652fd170d30fee3efee10ea68283187276165d4ac5c0d06ba3f3","observation_id":"901c9048-5ede-4c28-ae38-b51dac1b22fd","resolution":{"observed_at":"2026-08-07T14:37:49.207033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.171790Z","title":"prototype","venue":null,"work_id":"d7fb9cd4-e89a-422c-a7f6-5b68174df905","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.267563Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c4727a1b59ad5ff94780bc0fad42d6e63beb67f57b28f0639bec7e7fb42ae118","observation_id":"b897fa9b-2afd-4675-9485-e29701257712","resolution":{"observed_at":"2026-08-07T14:37:50.229956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.769331Z","title":"URL https://doi.org/10.18653/v1/D19-1410","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.769331Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:ee5d7169185d953b8f9c7e0fb0cb100833fbe7516b00c2c3dfc6534e912709f9","observation_id":"853b27f3-2c39-475c-a86a-ae09ebfd1b8f","resolution":{"observed_at":"2026-08-07T14:37:46.769331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-10T02:01:09.632053Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-07T14:37:48.423228Z","title":"URL https://doi.org/10.48550/arXiv.2412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.423228Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:2b7a66b146c9fa7305783859c8f007e1b140714bcf767d4608ce963874fe0c83","observation_id":"9d04d547-2c34-45ac-a980-11f7e7716d76","resolution":{"observed_at":"2026-08-07T14:37:48.423228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T01:45:33.256858Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 5 inbound Pith citation observations for arXiv:2505.18121."}