{"as_of":"2026-08-10T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79e5a700c4ccf4e0fee06a82d445dbe32c24e519f51944594afd0108b0af0e43","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:54.184865Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:41:45.971495Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19095","snapshot_observed_at":"2026-08-03T05:41:45.971495Z","title":"findings-acl.1158/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.01576","last_updated":"2026-05-23T02:41:44Z","snapshot_observed_at":"2026-08-03T05:41:42.857114Z","submitted_at":"2026-02-02T03:12:16Z","title":"Generative Visual Code Mobile World Models","version":2},"reference_index":1158,"source":"pdf_text","source_observed_at":"2026-08-03T05:41:45.971495Z"},"links":{"cited_paper":"/paper/2505.19095","citing_paper":"/paper/2602.01576"},"observation_digest":"sha256:b942b746aae4906c3ce76c6e43a61c2d557f0c29ceab3c7ee9c4252a5874e184","observation_id":"8b615e0f-a8f9-43db-ae7e-dc8bbecd39c8","resolution":{"observed_at":"2026-08-03T05:41:45.971495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19095/citation-record","integrity":"/paper/2505.19095/integrity","json":"/paper/2505.19095/citation-record.json","paper":"/paper/2505.19095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.136418Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.136418Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c559a9b1c145790723992b8788f7e59d977bdac2931d4b44441a01798a896a71","observation_id":"a3292f4e-d09b-4932-ac08-d87145fcc796","resolution":{"observed_at":"2026-08-07T14:23:50.136418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.950414Z","title":"Large language model-brained gui agents: A survey, 2025","venue":null,"work_id":"7c6e3bd1-6541-4cbd-88d4-8041e74b9b3f","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.196977Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:72579587a9c78b53231355d226315f3c05e9f6093409b4395a1dbfd999136953","observation_id":"1841d92c-6bfd-4290-b630-bf9fea057644","resolution":{"observed_at":"2026-08-07T14:24:01.017196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03186","last_updated":"2024-07-02T17:23:13Z","snapshot_observed_at":"2026-08-09T09:54:10.383680Z","submitted_at":"2024-03-05T18:22:29Z","title":"Cradle: Empowering Foundation Agents Towards General Computer Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03186","snapshot_observed_at":"2026-08-07T14:23:50.329553Z","title":"Karlsson, Bo An, Shuicheng Yan, and Zongqing Lu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.329553Z"},"links":{"cited_paper":"/paper/2403.03186","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:d6ea73700a17eb3a5752be55b072b850d7a5be2b40a55e10ad034b01510cc3d5","observation_id":"6a77df4c-1f84-49c8-9b50-0a4f2a18752e","resolution":{"observed_at":"2026-08-07T14:23:50.329553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-09T09:54:10.798330Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-07T14:23:50.446874Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction.arXiv preprint arXiv:2402.07939, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.446874Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:6e8daf988295fa3e69195a79f27360d36114be5ed823fd29dbdc608b8fbfde38","observation_id":"5c695656-7c0b-46a4-9cd2-71e600cebf31","resolution":{"observed_at":"2026-08-07T14:23:50.446874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14603","last_updated":"2025-04-25T05:14:14Z","snapshot_observed_at":"2026-08-10T09:19:45.491033Z","submitted_at":"2025-04-20T13:04:43Z","title":"UFO2: The Desktop AgentOS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14603","snapshot_observed_at":"2026-08-07T14:23:50.533706Z","title":"UFO2: The Desktop AgentOS.arXiv preprint arXiv:2504.14603, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.533706Z"},"links":{"cited_paper":"/paper/2504.14603","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:35708ce6d551d381f1b2470ae472a61a257bbf765c561caa8e57ada7ef80f35c","observation_id":"1180b532-608e-40c0-84ce-34287fb5ed8d","resolution":{"observed_at":"2026-08-07T14:23:50.533706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.782268Z","title":"Os-copilot: Towards generalist computer agents with self-improvement, 2024","venue":null,"work_id":"9a64d6ed-61cd-4dc4-8aeb-a3baf85d66eb","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.653068Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:608700e4ebb7817eb04c698e4f8aa97426d6c746c19510a61e0fef3e01316385","observation_id":"7e3b442b-7b62-4f51-b5d4-04109bb5290e","resolution":{"observed_at":"2026-08-07T14:24:00.863225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.646115Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","venue":null,"work_id":"26e2c66a-67bb-4973-bc8f-9c9833950b53","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.798187Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:49138297b7a2698bcd2b16892166beeb66a33a7cbdff5d928d774c0ad7eee265","observation_id":"719eb583-a018-426e-b4fd-808772b9329d","resolution":{"observed_at":"2026-08-07T14:24:00.697254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.916548Z","title":"Agent s2: A compositional generalist-specialist framework for computer use agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.916548Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3eb740ce1210ebee404d5d74e05dfa48d8032161fa77826ef66c207b4dd55098","observation_id":"3aecce86-7dd7-452a-9d1c-b2f15167120b","resolution":{"observed_at":"2026-08-07T14:23:50.916548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.032073Z","title":"Cogagent: A visual language model for gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.032073Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:cf8cc669233868f7a11eee3fb09fa1b09d005c83e2e6b7b8484e980f5adb0ec7","observation_id":"cd0ef37b-8122-4c27-bac6-cc395db8dfc7","resolution":{"observed_at":"2026-08-07T14:23:51.032073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.486772Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":"e11d36d9-638d-4d18-8cc2-9fea615ef6d6","year":2017},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.136114Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:23f97f64bac252af3fc88dbbc8b4f56f82044f05180283a4d81e91919b73dc7d","observation_id":"48fa1991-cd94-40cf-a87c-51cee5b7bf73","resolution":{"observed_at":"2026-08-07T14:24:00.566044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.332845Z","title":null,"venue":null,"work_id":"d78210d1-fa41-415a-a8bf-3338cdb58a64","year":2021},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.142987Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3c91c071647c1151dec1de2d3c4cd03fb0846ea50d25c444f2079a1638198dbf","observation_id":"1b881989-0c6b-4acd-984d-a19925ff2f34","resolution":{"observed_at":"2026-08-07T14:24:00.398909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.243633Z","title":"Mind2web: Towards a generalist agent for the web, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.243633Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:59a711b95a0382a5a6fe28e20698ae514ea5d775cf1ff399a8f54ba83520efc1","observation_id":"6fa864d2-cb97-46a0-8ea2-36b9ad82eecf","resolution":{"observed_at":"2026-08-07T14:23:51.243633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.117211Z","title":"Mobilevlm: A vision-language model for better intra- and inter-ui understanding, 2024","venue":null,"work_id":"b8816e0b-6af3-48c7-9f0c-3e33c1ce6994","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.319588Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:fa47ca33aa8f10f8ef6d826370e6c3a8546945cc36ba49dbed8ea3e39e7a77b3","observation_id":"d925d938-98a7-4c27-9563-75995874c1dd","resolution":{"observed_at":"2026-08-07T14:24:00.221133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.931424Z","title":"Screenagent: A vision language model-driven computer control agent","venue":null,"work_id":"cbd9d057-60cb-42d1-8b72-b5cb3733c6cc","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.397691Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:2911aaa1e2664cd787eefa3f560a7e649c5ca5df3a9a00b53bf49b64c61b7a4a","observation_id":"45802f04-c31b-41af-b303-5f5aec6d7ad6","resolution":{"observed_at":"2026-08-07T14:24:00.030072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.795957Z","title":"Guicourse: From general vision language models to versatile gui agents, 2024","venue":null,"work_id":"f0616737-beaf-463f-8d60-889e4180c434","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.450062Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:edc3d44b613a0930d5ec846da7ed864bf5ba221210f4de8b6edac4794b4e34b2","observation_id":"bb6537af-054a-4da5-a473-c26b3676e54f","resolution":{"observed_at":"2026-08-07T14:23:59.839812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.520085Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.520085Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:6690291a9a1d5b6ca42e4d584bb83713574c0d97e7cb470dcd3d107066bfb635","observation_id":"886679a2-9596-4cfd-a107-709612b1eeb9","resolution":{"observed_at":"2026-08-07T14:23:51.520085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.559611Z","title":"Exploration by random network distillation, 2018","venue":null,"work_id":"17ae6a39-452e-4cfb-bac0-d98502ccbb11","year":2018},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.572170Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0cc856269cbc16f95e7fd2efa7c143040ceaf1b133b32cc0052cdda91ce19f3b","observation_id":"e31bcd74-d63b-4af6-abd7-bf2f386a552b","resolution":{"observed_at":"2026-08-07T14:23:59.702983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.287633Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"e75e1972-a888-43d9-8a8f-e4a1c40b1e65","year":2021},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.637693Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c1f83e24933386425d759626869c3c554960bbfc92bb1ebf2a09ea3e515ce541","observation_id":"b1649282-0b2e-4782-9894-3caa7d3f2f54","resolution":{"observed_at":"2026-08-07T14:23:59.439194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.041109Z","title":"Diversity is all you need: Learning skills without a reward function, 2018","venue":null,"work_id":"989dd0b2-31f4-4c3d-8794-75dc4d204df2","year":2018},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.709534Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c748201cf7610cf72995e64fc644b91b27caaf89e58762e47ff264c9f5e38aa1","observation_id":"ed778763-8992-42f6-a376-fe4a98c01f69","resolution":{"observed_at":"2026-08-07T14:23:59.180697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.824667Z","title":"Dynamics- aware unsupervised discovery of skills, 2020","venue":null,"work_id":"756964fb-826a-4127-bc17-2cb5d0d43df4","year":2020},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.792160Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:978fade325f2311cfa35004183efe561637be41bc7eb0528d3acdd53c292f7f9","observation_id":"348e6354-4c97-465f-8459-04e07c87a687","resolution":{"observed_at":"2026-08-07T14:23:58.931445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.856964Z","title":"V oyager: An open-ended embodied agent with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.856964Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c4a7b50878ec7de19d6c2813240b8804e0ab24d82ef785af8c581db6b1f45b27","observation_id":"1f1b9ca9-2968-48c8-815e-e07cfd6f13fc","resolution":{"observed_at":"2026-08-07T14:23:51.856964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.569193Z","title":"Tenenbaum, Tim Rocktäschel, and Edward Grefenstette","venue":null,"work_id":"3e1024e9-cb75-4e67-a7f9-c7e3f4bcdb1a","year":2021},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.925314Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:267789f874a8065efd493bbe11aeba8986a1081619c2a142639ecba399022efd","observation_id":"d3ddebf6-0a95-449c-a878-6a69d9a06573","resolution":{"observed_at":"2026-08-07T14:23:58.697187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.331823Z","title":"Open-world reinforcement learning over long short-term imagination, 2025","venue":null,"work_id":"c65e69a1-9c4d-4af5-8785-9c29635449e4","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.995562Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:dce125ab299b151179c29b158f4fb856e6b9dab5935168ae457e0bad908a46bb","observation_id":"42fec0c1-8510-4a49-b151-716177ef56df","resolution":{"observed_at":"2026-08-07T14:23:58.434680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.108204Z","title":null,"venue":null,"work_id":"9e620e6b-fe01-4e93-b750-610b82a4704f","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.048337Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:f9e06ba2497915b581df025039476e5ac51d5908805810bfd7c6f3c8bc1b8828","observation_id":"49491ffc-7351-47d5-8892-51d8de8c3bae","resolution":{"observed_at":"2026-08-07T14:23:58.213090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.112981Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.112981Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:752a3a45764f074d7b912e99c140a6fa3db2a6f2e300cd02a8ac6f7c7b369531","observation_id":"2bb7b0b7-315c-48c1-8316-171965c873eb","resolution":{"observed_at":"2026-08-07T14:23:52.112981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:57.730142Z","title":"Mutual reasoning makes smaller llms stronger problem-solvers, 2024","venue":null,"work_id":"4e0b9e27-f279-4fab-94a3-0b592d504ebd","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.194199Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:bf2ffad4bda9aafe0375d48964e6ebb9977e7f3632b53cc993ba0fc67d9d362d","observation_id":"bf34e17c-af05-4439-b861-23a6c1157da5","resolution":{"observed_at":"2026-08-07T14:23:57.879733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:57.465319Z","title":null,"venue":null,"work_id":"33e8f8f1-c4bb-4bc8-ba86-070e61601e8a","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.282678Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0ca98ff609a351f7e39cf4fe6b3f0c13ae51990338fcd0dcf762792a31db4fe3","observation_id":"75e9669b-d764-4dfb-9f92-bd04a518355e","resolution":{"observed_at":"2026-08-07T14:23:57.580006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:57.222183Z","title":"Improving rl exploration for llm reasoning through retrospective replay, 2025","venue":null,"work_id":"0ed094e1-322d-4c1e-8966-5bb4883c7e81","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.361528Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0bc4bf50980da14f7e2d2428103cb029c3b0c71685ce5252460a52726d38d58c","observation_id":"50337ece-f62a-480c-9e05-ee45f06b1f9f","resolution":{"observed_at":"2026-08-07T14:23:57.339753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.429742Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.429742Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:a15f20ab3063b1a7f7078da403fe6c56e7a62334e8f7d25e9ab36b05d51f6209","observation_id":"11e10259-1368-4963-8894-e494bb2886e9","resolution":{"observed_at":"2026-08-07T14:23:52.429742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.990151Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":"01068ae6-687d-4534-a663-e30384a94af6","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.518291Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:e321073970ea90d7872abb23845bc10284dcf092c6a37db9195e1923f9654324","observation_id":"3d6a367f-9159-4fd1-a787-d4c622a6410a","resolution":{"observed_at":"2026-08-07T14:23:57.071670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02006","last_updated":"2025-09-14T09:13:39Z","snapshot_observed_at":"2026-08-09T09:53:28.792027Z","submitted_at":"2024-11-04T11:50:58Z","title":"Foundations and Recent Trends in Multimodal Mobile Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02006","snapshot_observed_at":"2026-08-07T14:23:52.565138Z","title":"Foundations and recent trends in multimodal mobile agents: A survey.arXiv preprint arXiv:2411.02006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.565138Z"},"links":{"cited_paper":"/paper/2411.02006","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:1e3516c2ede1aa9a97336667f84948714432a606a2759fb23ef87e4ac654b5e5","observation_id":"cecc6fc2-b50f-4d92-a74d-9b6c27ccf459","resolution":{"observed_at":"2026-08-07T14:23:52.565138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.649898Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.649898Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:54da2b485afcd8f13a6f374fce50f9643bac468473d4f173c3088c0aba1feb44","observation_id":"4afb4400-b6a4-499d-aee7-52aa24ce6fb6","resolution":{"observed_at":"2026-08-07T14:23:52.649898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.818836Z","title":"Karlsson, Bo An, and Zongqing Lu","venue":null,"work_id":"b9818a9a-6c65-4feb-8708-06d8993a2f87","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.712806Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:bb8d353138d8ad9d5f1067c1535c54c8ed2ca4747f5bf648f8cf30bc6ae1a3f5","observation_id":"1dabb108-50d2-4c56-9727-06916e0d11a7","resolution":{"observed_at":"2026-08-07T14:23:56.896119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.805502Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.805502Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:283b0a4228b58cdfa544707ed03b236a98eb599ca496261b3824ecefcdb4f3de","observation_id":"603aca4e-1589-44d9-b2e3-cc95868b8c64","resolution":{"observed_at":"2026-08-07T14:23:52.805502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.879340Z","title":"Au- tonomous evaluation and refinement of digital agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.879340Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:8698eef29bbb1086e33f32834743d1974aa7cb1b142d23f3ceac3092b133d80a","observation_id":"7b25cece-4247-4994-9aff-d23e7f241afc","resolution":{"observed_at":"2026-08-07T14:23:52.879340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.680277Z","title":"Distrl: An asynchronous distributed reinforcement learning framework for on-device control agents, 2025","venue":null,"work_id":"bc460cad-4bbc-4c8f-ba1f-97e477fca19e","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.933677Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:f70edb3900460b3037f4ad7a1cd6cafbf3e0d5014427c71ca5fde19b7f60c4cd","observation_id":"9ad340ca-1b8e-4042-98cc-5fde0cdcdf7c","resolution":{"observed_at":"2026-08-07T14:23:56.739056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.005703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.005703Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0dc3f9474cd3c2db1108d3c228f477f3a37fe0944b5d3373e393a20da437a1b0","observation_id":"d425806b-2a29-469a-a0d3-1d1bfc839ac0","resolution":{"observed_at":"2026-08-07T14:23:53.005703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.064052Z","title":"Lee, and Sanjeev Arora","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.064052Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:769f8274ddaa5ce35fbffb977b54180f468f49726901bfcd89a6c4d15aa1e746","observation_id":"fc3fc8ab-73cb-4653-847e-dd74aaca283d","resolution":{"observed_at":"2026-08-07T14:23:53.064052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.496694Z","title":"Mavor-Parker, Kimberly A","venue":null,"work_id":"1929d0d1-00e0-4bba-865c-cab3abd63e0e","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.173149Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0d579e81ce8dc1d09e1dc567f574bed09cf4186bf4345ab79f8fcd5ee30fcdc4","observation_id":"9b77a3f1-0941-45c4-8911-fe8a74a93566","resolution":{"observed_at":"2026-08-07T14:23:56.574673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.349978Z","title":"Space\") Key(","venue":null,"work_id":"becee88d-3077-48fe-bbf3-fe1857d09c5d","year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.239568Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0ae6a437a05aa249cd3cbd854d2fb701b6dd63d0b5a869f2f3536e25a7d42659","observation_id":"7b0f6701-aea2-41c1-a5b0-fe99e6958354","resolution":{"observed_at":"2026-08-07T14:23:56.430888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.970650Z","title":null,"venue":null,"work_id":"f1613444-cd48-4e13-9d6f-94645d7b5eaf","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.400607Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c99397e01f6b8b96b9a33ed9f4aac2132f76cdd36734bfd8aaeba2ef49af7806","observation_id":"b7539549-4679-4fa9-81f2-85e4947a2bdc","resolution":{"observed_at":"2026-08-07T14:23:56.085069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.827973Z","title":null,"venue":null,"work_id":"5d6cd0bf-e88e-4e86-a70b-2a03744394d9","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.495641Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:74cfed3c51cde10bc4d2114fc720890f2a4566bc715fce64bb60a37fd50951c7","observation_id":"56678f19-20c1-4a44-b7a7-65cf15b20809","resolution":{"observed_at":"2026-08-07T14:23:55.888651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.643230Z","title":"In addition to manual filtering, we implemented an automated filtering process without human intervention, based on the following criteria:","venue":null,"work_id":"6ff3d862-66e7-4c66-9848-92f3ceffc444","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.540034Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:f0289f79b67e52cc03f5a91cf2c70f130e9a284a321ae848ecdc822fefd96cce","observation_id":"54fc38ff-24b8-4971-8a2e-031738810fe6","resolution":{"observed_at":"2026-08-07T14:23:55.736158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.187441Z","title":null,"venue":null,"work_id":"6ed9936d-6c18-48ef-9682-7e9008bc998c","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.635922Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:879fe723be3586c70d7624d01e8eab6173cf8681398861b131a44ab4cce97dad","observation_id":"9f31d864-8f47-448f-8e2e-b3eaa504b84d","resolution":{"observed_at":"2026-08-07T14:23:56.285758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.414960Z","title":null,"venue":null,"work_id":"a80860de-9cf6-488a-885c-1b9c2cd1eafd","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.703424Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:1c65764ef7468f5633e935a30da12a8b3ae2439d6dcbc90b5c3d1f3649095f6a","observation_id":"7880a239-c63d-4698-87b2-6399d3a43669","resolution":{"observed_at":"2026-08-07T14:23:55.528954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.264556Z","title":null,"venue":null,"work_id":"8f72f9a1-caf0-49ae-a5d8-eedc32e0b716","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.787016Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:b781bd8b01ce927ff06ce58ddbfd7e4914d3e44d94cb40d2881544aa2e8a54f5","observation_id":"85dc835d-dee0-4a12-8132-37246d8dd7aa","resolution":{"observed_at":"2026-08-07T14:23:55.314113Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.044376Z","title":"The automated filtering employs the following prompts: You are evaluating whether an intent string clearly specifies a computer operation instruction","venue":null,"work_id":"96196918-2330-4ad1-a7d1-cdccdf06fd8a","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.857027Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:bbb980301a992c5543c6e709c689fb6e3691aa3d2d325841621c9b01d8f06bc9","observation_id":"71039ee4-603c-4e2c-b877-ecf0ebb46b31","resolution":{"observed_at":"2026-08-07T14:23:55.150547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.875914Z","title":null,"venue":null,"work_id":"106d2aa2-1e86-41a2-95b6-f35a58a9898d","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.943697Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:66cf673f9c33da75be5121b89768690dab834d42199a2af10854e4c71f3eae0b","observation_id":"97d6c8ef-1dfb-4211-b256-ec3adef2473b","resolution":{"observed_at":"2026-08-07T14:23:54.967118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.681257Z","title":null,"venue":null,"work_id":"db392b87-acf0-40b4-9a08-ee68af4e2fc8","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:54.027798Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:ad4b17f8c15331517a1e43c2ebea9e4aa6db84505f196bb70c7841d97cdfd2a1","observation_id":"651c6821-1e68-4932-960f-d508814caaf3","resolution":{"observed_at":"2026-08-07T14:23:54.775805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.535736Z","title":null,"venue":null,"work_id":"4081de51-d985-4b9a-8660-1ebe3b84a1e9","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:54.101767Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:61fd1b6cf8177bf543fa4517bcf1384e701e5708089aa7c60800ad5cb9881b09","observation_id":"6235fa44-90d6-4100-aaf1-3b699d3129c7","resolution":{"observed_at":"2026-08-07T14:23:54.594976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.381213Z","title":"{{intent}}","venue":null,"work_id":"0f969c27-c628-4567-bd58-96c4b50d656f","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:54.184865Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:aec174b808d69a073c3912b18419fda49f6a01b699b2a153d32ee88ebc7510dc","observation_id":"1410146d-0864-4a4c-8255-46a12e44e094","resolution":{"observed_at":"2026-08-07T14:23:54.449870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T09:54:06.574364Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":27,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2505.19095."}