{"as_of":"2026-08-18T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a0ed31d2219cc64e132c3f06ebcbaa5d1efe9c31559740970308d3f2899a6dc","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:10:29.052921Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:05:09.289637Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T11:08:27.767412Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":"2412.10342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining","venue":null,"work_id":"88ae369e-8744-4fa9-8647-2ba8ae2d0886","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-08-17T10:40:45.253009Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:b3d204cc04bed686c767b3466776dc41d960c5cccd754be71d63b1e35e81428c","observation_id":"f7565c5c-5909-4277-bacb-4540ca8286ba","resolution":{"observed_at":"2026-05-19T11:08:27.769205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-07T05:02:29.178376Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08933","last_updated":"2025-06-10T15:59:38Z","snapshot_observed_at":"2026-08-17T17:45:42.396476Z","submitted_at":"2025-06-10T15:59:38Z","title":"What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:02:29.178376Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2506.08933"},"observation_digest":"sha256:acc0857a8fcf1b97d0407ee695d4d63bae74705607357dab3b40bc5f6618fdbf","observation_id":"47c6f886-57fb-4877-b41b-63b287dd429e","resolution":{"observed_at":"2026-08-07T05:02:29.178376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-07T04:35:36.675559Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining.arXiv preprint arXiv:2412.10342, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10387","last_updated":"2025-06-12T06:21:19Z","snapshot_observed_at":"2026-08-16T02:56:21.500616Z","submitted_at":"2025-06-12T06:21:19Z","title":"Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:36.675559Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2506.10387"},"observation_digest":"sha256:51506316cd718dcfeaa9b0e4db3d4b6f86541e34939d771ba6397273dbd05fd5","observation_id":"77fc636a-8af5-4362-9d75-3febd07cdabc","resolution":{"observed_at":"2026-08-07T04:35:36.675559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-15T18:05:09.289637Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19132","last_updated":"2025-07-25T10:14:53Z","snapshot_observed_at":"2026-08-16T13:46:06.537646Z","submitted_at":"2025-07-25T10:14:53Z","title":"OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T18:05:09.289637Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2507.19132"},"observation_digest":"sha256:538335320b476a917cac088f2a29b9c6b9ba428eb2c5f8af29c974101bdacb98","observation_id":"3befbff8-0d15-4f3a-8a88-950c2955dd53","resolution":{"observed_at":"2026-08-15T18:05:09.289637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-05T17:45:21.052024Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16688","last_updated":"2025-08-21T18:39:35Z","snapshot_observed_at":"2026-08-16T21:30:29.751711Z","submitted_at":"2025-08-21T18:39:35Z","title":"Cybernaut: Towards Reliable Web Automation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:21.052024Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2508.16688"},"observation_digest":"sha256:f64d310d7bcb97119e3419ca7917de8baf96e38cc7f92d082ef11f2b00b3322a","observation_id":"74b247d5-9142-405e-9f6f-6930299855d2","resolution":{"observed_at":"2026-08-05T17:45:21.052024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-04T16:51:32.578220Z","title":"Iris: Breaking gui complexity with adap- tive focus and self-refining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-16T14:03:41.431978Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.578220Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:9561ff37f3f58f9e9f81657ddfd727ee8a626f543605a6c72aefad5ddf7b854b","observation_id":"5c57e7fd-9a60-4885-8155-74ba7bfae981","resolution":{"observed_at":"2026-08-04T16:51:32.578220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10342/citation-record","integrity":"/paper/2412.10342/integrity","json":"/paper/2412.10342/citation-record.json","paper":"/paper/2412.10342"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T16:10:28.867498Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.867498Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:6f78147ea0de8400482398727d051c1c8d2f8ba50e26a9720f67da31f0f2dde1","observation_id":"462e3955-cf34-447e-927d-7ae20125979e","resolution":{"observed_at":"2026-08-11T16:10:28.867498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.621941Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"924597e7-a036-465f-b099-9fab7057e182","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.871745Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:8dea282269cf47047ffb810208a4077b16ef43ee1234c6650bbf15e31957441e","observation_id":"c4ad8e76-eebd-4533-aa3b-301bea25e978","resolution":{"observed_at":"2026-08-11T16:10:29.626618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T16:10:28.876033Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.876033Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:498a1da27307ab97a26ec4ce0826713942741e02eea6d385e65f45e823368d01","observation_id":"e63e462a-5b70-42a4-99ee-39e041a9fc6b","resolution":{"observed_at":"2026-08-11T16:10:28.876033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.608374Z","title":"Fuyu-8b: A multimodal architecture for ai agents, 2023","venue":null,"work_id":"1a917767-db3d-4d48-afe2-c5355ed93f98","year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.880833Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:a85240e4cd515b97e119ee9b07d68612ed736cd486595f9f7e00220b5d197874","observation_id":"597c723d-1b13-47e2-9d6d-a7426cb03235","resolution":{"observed_at":"2026-08-11T16:10:29.613252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T16:10:28.886036Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.886036Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:6e5a8e6ac471fe50ec8e0026989925a56fe8baeb3308a86b2aad20724f903b22","observation_id":"cbce299e-ea7c-4a85-94ba-5118a2da68df","resolution":{"observed_at":"2026-08-11T16:10:28.886036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.594917Z","title":"A computational approach to edge detection","venue":null,"work_id":"a08a7a5e-6049-40ff-982b-f86f2a399f59","year":1986},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.891368Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:0c796e11ac80c452ce6e4008f383067495bd181a92dff7f458ce2e4d54b469b6","observation_id":"bd8dfdc6-b39b-41ec-9778-7ec9d835ba5e","resolution":{"observed_at":"2026-08-11T16:10:29.599787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T16:10:28.895775Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.895775Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:82bc2ac9b8a0322fa7cc8d306240b386ee95ec9512ae8a914078fd8088201a6b","observation_id":"28b90062-3e2e-427a-b6ec-1f8a01c43495","resolution":{"observed_at":"2026-08-11T16:10:28.895775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-18T02:03:58.046358Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-11T16:10:28.900333Z","title":"Seeclick: Har- nessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.900333Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:c36a45f4b517a5d6dfa8e33dd17427d1362ff56a60d332dc4fa80eb588e9280f","observation_id":"8ff0e854-320f-4a49-b9da-92e317c5fbe5","resolution":{"observed_at":"2026-08-11T16:10:28.900333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.580534Z","title":"Rico: A mobile app dataset for building data- driven design applications","venue":null,"work_id":"6122bcdf-ccfc-4ad8-8028-41262b7e37b8","year":2017},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.905456Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:8595a3ad3c941cc4428be590810c78f3227e41d24c82f5844e5f59fbc1257443","observation_id":"f2e8ef3f-266a-4633-810c-aa30d6e6b477","resolution":{"observed_at":"2026-08-11T16:10:29.586082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.567588Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"901fc999-50a1-40a2-b280-891eba14374b","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.910089Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:1a212f997ade0ae2fbcc87ae406d5196dc0bb049b0348b387c5ea0f5ed5ea84b","observation_id":"16f9c842-52c8-460f-980c-c3003bb7ad60","resolution":{"observed_at":"2026-08-11T16:10:29.571928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-18T00:33:47.386234Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T16:10:28.919795Z","title":"Internlm-xcomposer2- 4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.919795Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:b8ac2202efc93b1a417349c441527b09c510bc682f7cbd1e3b03f0a433ffa1a1","observation_id":"9161f461-1e60-4f8f-ad7d-c8fab868559b","resolution":{"observed_at":"2026-08-11T16:10:28.919795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.554307Z","title":"Vitron: A unified pixel-level vision llm for understanding, generating, segmenting, editing","venue":null,"work_id":"39cc476c-8c01-40e1-9ca1-0a88f7875d5a","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.924452Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:f4c4bf942a05eb7c7676b30c997d3d24698e6a109c4c37a5a5cd2618884148eb","observation_id":"1ecf13a7-a279-4d13-9cbc-f554050ecf88","resolution":{"observed_at":"2026-08-11T16:10:29.558706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.539646Z","title":"Enhancing video-language representations with structural spatio-temporal alignment","venue":null,"work_id":"e15f833f-cd0b-4be3-97b0-e3d6f3411776","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.929413Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:58e0a100831406a9520577246ffa0a7865db0d3954d12c95035338e86a013345","observation_id":"773d8398-3400-446b-b473-f82fb8d2d359","resolution":{"observed_at":"2026-08-11T16:10:29.544854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10943","last_updated":"2024-11-17T02:44:56Z","snapshot_observed_at":"2026-08-16T10:37:51.980574Z","submitted_at":"2024-11-17T02:44:56Z","title":"Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10943","snapshot_observed_at":"2026-08-11T16:10:28.934341Z","title":"Generalist virtual agents: A survey on autonomous agents across digital platforms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.934341Z"},"links":{"cited_paper":"/paper/2411.10943","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:3194cd43e4e1fd11e94782ea1854d99dbb19f352aa6e613cd5ad6e77454418f1","observation_id":"fb87489d-35a0-4b1b-8583-082cafbd7f0b","resolution":{"observed_at":"2026-08-11T16:10:28.934341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.524149Z","title":"De-fine: De composing and re fin ing visual programs with auto-feedback","venue":null,"work_id":"b8e584d8-f79e-417c-9bb3-190acaf395f1","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.938874Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ad1eac45efbbf6d56c04bc24ee4c9d6faca3890692febb5785346c02a7b94ff4","observation_id":"84e459e8-4348-4432-aee6-c3c6fbecdebe","resolution":{"observed_at":"2026-08-11T16:10:29.529117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-08-17T12:05:03.684448Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-11T16:10:28.942871Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.942871Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:6535b517bb3c42d38f6d71d8575eb6d28d970ccf6edbee4597d8fb0337132d03","observation_id":"6c3b1587-661a-4697-bd1d-429b24c7400d","resolution":{"observed_at":"2026-08-11T16:10:28.942871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T16:10:28.947119Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.947119Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:3399afa1b111caec84875dfded0dda4445864e979f43d4a8741d1eac203d2a73","observation_id":"22c75973-7a83-4169-89d2-a9460907a033","resolution":{"observed_at":"2026-08-11T16:10:28.947119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.510838Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"4a2459e0-22f0-4773-8bfc-5f991e2865da","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.951617Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:0335b8662bca588660df69af537786c2d1236cfecc1006da7539312653249230","observation_id":"a3c0777f-3afa-4d7d-b4da-da34b226b0d3","resolution":{"observed_at":"2026-08-11T16:10:29.515180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T16:10:28.955772Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.955772Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:fb829cf0c0ef539ea56b9db4c9e7a7af54870e435c18be400cf6cfd667f73ff4","observation_id":"1aa0533d-9155-4c66-a343-9d715d165d60","resolution":{"observed_at":"2026-08-11T16:10:28.955772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T16:10:28.960093Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.960093Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:598b247ad988a00f1942ffdabd54363ac10caafd355eca71b6bfd0bfe39bd179","observation_id":"d4cab38e-5f1c-4b08-9d62-1bf1787e5236","resolution":{"observed_at":"2026-08-11T16:10:28.960093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-08-16T15:10:01.454046Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-08-11T16:10:28.964021Z","title":"Fine-tuning multimodal llms to follow zero-shot demonstrative instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.964021Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:913e06492b320e487595f6cb1df1fa46660786f07a32d34cc533f3b28c4a297c","observation_id":"f944425b-8ed8-4f99-bccc-f632f40237ad","resolution":{"observed_at":"2026-08-11T16:10:28.964021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18967","last_updated":"2025-02-28T00:29:14Z","snapshot_observed_at":"2026-08-18T16:49:42.786864Z","submitted_at":"2024-10-24T17:58:31Z","title":"Ferret-UI 2: Mastering Universal User Interface Understanding Across Platforms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18967","snapshot_observed_at":"2026-08-11T16:10:28.968225Z","title":"Ferret-ui 2: Master- ing universal user interface understanding across platforms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.968225Z"},"links":{"cited_paper":"/paper/2410.18967","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:e3c423e8a3d25d01d4b728996a23c4dc8f5399d46737d0f3ccad8c3231dde013","observation_id":"129b2dc6-8eab-42b7-a7c6-cc38c7c21a3c","resolution":{"observed_at":"2026-08-11T16:10:28.968225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-18T00:33:51.822601Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-11T16:10:28.973202Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.973202Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:b613f279223dc5d0d91c3eb4dfeb45978e2bcbc76e8e6afa9d303856db6bf134","observation_id":"289ae9cd-18e5-408e-a7a0-98ad1fee55ee","resolution":{"observed_at":"2026-08-11T16:10:28.973202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.496970Z","title":"Visual instruction tuning","venue":null,"work_id":"fa0fbf7d-b77d-4d55-b73b-9628328d3943","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.977592Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:84682ecf246998b402a96206c7e35c4f13b3fcba9fa9dd21c5f75d4015c8c71f","observation_id":"15d50b90-e9ce-4b7e-a6f2-044a0d703951","resolution":{"observed_at":"2026-08-11T16:10:29.501267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-08-17T00:01:45.419694Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-08-11T16:10:28.981478Z","title":"Visualwebbench: How far have multimodal llms evolved in web page under- standing and grounding? arXiv preprint arXiv:2404.05955,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.981478Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:11c7efc9446fa04578690dc311bb8721a6d8716ab204ecb0b0dfc32f21b04f47","observation_id":"c24df63a-9a42-40c3-b1d7-218e41340dab","resolution":{"observed_at":"2026-08-11T16:10:28.981478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08451","last_updated":"2025-08-01T03:37:57Z","snapshot_observed_at":"2026-08-16T13:43:38.458825Z","submitted_at":"2024-06-12T17:44:26Z","title":"GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08451","snapshot_observed_at":"2026-08-11T16:10:28.985979Z","title":"Gui odyssey: A comprehensive dataset for cross-app gui navigation on mobile devices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.985979Z"},"links":{"cited_paper":"/paper/2406.08451","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:663cc44fe31f27b3cb9df2b1311de1fffa8e9f942c3cdffcf37a6dd68633996b","observation_id":"40a18b4c-7574-4144-be21-f9f3feecea53","resolution":{"observed_at":"2026-08-11T16:10:28.985979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.483457Z","title":"Androidinthewild: A large- scale dataset for android device control","venue":null,"work_id":"13b2d431-39ef-47be-ac80-fbbeac232b04","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.990556Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:b3073a53547b057ab6b0ab28f423c4595137c77794cab0e44a7da331296bc0af","observation_id":"380ec206-46c8-4459-818a-ea52b28e16a6","resolution":{"observed_at":"2026-08-11T16:10:29.487904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11029","last_updated":"2022-11-24T06:34:43Z","snapshot_observed_at":"2026-08-16T16:58:31.432274Z","submitted_at":"2022-05-23T04:05:37Z","title":"META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11029","snapshot_observed_at":"2026-08-11T16:10:28.994614Z","title":"Meta-gui: Towards multi-modal conversational agents on mobile gui","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.994614Z"},"links":{"cited_paper":"/paper/2205.11029","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:e3980b64334ca1cbe42ccf07f878b2d93c68f8b0be6db259950d31582d86d2f4","observation_id":"267af3bb-898f-4b25-a1a4-f66b759c0e5b","resolution":{"observed_at":"2026-08-11T16:10:28.994614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T16:10:28.999032Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.999032Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:8ed12d908f5d1da1a2526debd59274fc15c538aabf347286585a8caad4f14fc1","observation_id":"ecc04415-d9a4-4a04-b8e2-a5d56b3acf59","resolution":{"observed_at":"2026-08-11T16:10:28.999032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T16:10:29.003225Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.003225Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:18466656c08f3f97e785cd15867b8dfec9f0205927ac8433e5abbad9a90fee92","observation_id":"a81b2c2d-c420-4e5b-b61a-f9a6127e8a3b","resolution":{"observed_at":"2026-08-11T16:10:29.003225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T16:10:29.007597Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.007597Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:49b4fed8aa575421996192961ab411f6c4cb5341cf543b8f741c59f9ca9026c8","observation_id":"6adb5cd8-dc24-41e8-aa01-80ca931d4788","resolution":{"observed_at":"2026-08-11T16:10:29.007597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-16T13:42:20.592010Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-11T16:10:29.011807Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.011807Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:a1330451ff2de211ca00be7c27e820919c16662709c32f4521b614d22f9a40cd","observation_id":"d45563af-ff1d-4516-9a54-3295ee6150cb","resolution":{"observed_at":"2026-08-11T16:10:29.011807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T16:10:29.016231Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.016231Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:cbdaf30e07efa29d6cd01150b9a8ffb40b472a01d5b97d27921df3b19c0841f3","observation_id":"9a5de42d-6139-49b2-8e43-8918c866aafa","resolution":{"observed_at":"2026-08-11T16:10:29.016231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.467864Z","title":"Webui: A dataset for en- hancing visual ui understanding with web semantics","venue":null,"work_id":"3b7c0300-424b-4e7b-9642-d11769709c20","year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.021156Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:0dd1c2042ae2136727267986b5972054b0307376e1a2689b4af6edbf7d0d7f1f","observation_id":"ebddd9d9-b86a-4cc9-ac30-ded666f716c7","resolution":{"observed_at":"2026-08-11T16:10:29.474038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07456","last_updated":"2024-02-15T09:30:48Z","snapshot_observed_at":"2026-08-16T14:19:26.200721Z","submitted_at":"2024-02-12T07:29:22Z","title":"OS-Copilot: Towards Generalist Computer Agents with Self-Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07456","snapshot_observed_at":"2026-08-11T16:10:29.025490Z","title":"Os-copilot: Towards generalist computer agents with self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.025490Z"},"links":{"cited_paper":"/paper/2402.07456","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:76d8df083e098df9ccccd1fc75cf4398aa354aec807b25942605cc4b3f340aae","observation_id":"b2baf02b-11ac-4e2e-a2ef-d21b6122ef8e","resolution":{"observed_at":"2026-08-11T16:10:29.025490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T16:10:29.030128Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.030128Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:11e052271429866c59a34b1d87e06bca45b5868aa63ef8841891ea5ece14023a","observation_id":"a0472031-8831-4bed-a82c-bec1764fb727","resolution":{"observed_at":"2026-08-11T16:10:29.030128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-08-16T14:02:38.146712Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-11T16:10:29.034981Z","title":"Ferret-ui: Grounded mobile ui understanding with mul- timodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.034981Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:da3b895941a990f54a63c7982bb66124ad8003e86ae61c01995563c072071986","observation_id":"c5859b87-0094-4be4-b9a5-d5c06f4380e6","resolution":{"observed_at":"2026-08-11T16:10:29.034981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-18T14:41:50.057065Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-11T16:10:29.039295Z","title":"Ufo: A ui-focused agent for windows os inter- action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.039295Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:05fa2d4c221af09ebb18cd41eb79fde5fc9911f6a91baee2186d505ded9dfbce","observation_id":"80058f2c-f2a8-43f9-8ec5-975a8065a7b3","resolution":{"observed_at":"2026-08-11T16:10:29.039295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11436","last_updated":"2024-06-07T04:52:29Z","snapshot_observed_at":"2026-08-16T14:59:03.737515Z","submitted_at":"2023-09-20T16:12:32Z","title":"You Only Look at Screens: Multimodal Chain-of-Action Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11436","snapshot_observed_at":"2026-08-11T16:10:29.043380Z","title":"You only look at screens: Multimodal chain-of-action agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.043380Z"},"links":{"cited_paper":"/paper/2309.11436","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:717f113bc5d9d39e32bdaec2003d3928142c8c5819f6e996d7c2105add548ad0","observation_id":"94f898c5-0801-4a50-83b5-d594cfead54d","resolution":{"observed_at":"2026-08-11T16:10:29.043380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17918","last_updated":"2025-02-14T08:13:39Z","snapshot_observed_at":"2026-08-18T09:23:21.297977Z","submitted_at":"2024-03-26T17:54:15Z","title":"AgentStudio: A Toolkit for Building General Virtual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17918","snapshot_observed_at":"2026-08-11T16:10:29.048625Z","title":"Agentstudio: A toolkit for building general virtual agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.048625Z"},"links":{"cited_paper":"/paper/2403.17918","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:6154203157ecedf14fae8abbc2ac6110d854be4f86bd5e7051512bb2f62633d1","observation_id":"7453521a-0ec9-4fb6-aeb3-7a19c1943f9f","resolution":{"observed_at":"2026-08-11T16:10:29.048625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-11T16:10:29.052921Z","title":"Webarena: A realistic web en- vironment for building autonomous agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.052921Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:eb7ed3e82ccc7aac5d927a7f052e535b03dec20f6f4fe6bca70ebff857c5d11b","observation_id":"ff225322-4c23-4035-a16e-c71e1281f2f0","resolution":{"observed_at":"2026-08-11T16:10:29.052921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 6 inbound Pith citation observations for arXiv:2412.10342."}