{"as_of":"2026-08-10T14:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d1c2a094801262ea83c99fb9f49807a35bdac25f0f17eb563bf75344accf81a","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:37:54.570747Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:29:38.413995Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T12:28:07.426391Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06395","snapshot_observed_at":"2026-08-09T10:29:38.413995Z","title":"Appvlm: A lightweight vision language model for online app control, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02982","last_updated":"2025-05-20T07:03:02Z","snapshot_observed_at":"2026-08-10T06:25:08.101161Z","submitted_at":"2025-02-05T08:26:17Z","title":"MobileA3gent: Training Mobile GUI Agents Using Decentralized Self-Sourced Data from Diverse Users","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T10:29:38.413995Z"},"links":{"cited_paper":"/paper/2502.06395","citing_paper":"/paper/2502.02982"},"observation_digest":"sha256:ee4a0531dcb69a3b486d4f7312a359e46cdae466b9b7c9e258f7bd5f34ac1e47","observation_id":"49dd3956-04e7-44dc-a042-0e90ca4b8803","resolution":{"observed_at":"2026-08-09T10:29:38.413995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06395","snapshot_observed_at":"2026-08-07T14:38:14.313795Z","title":"Appvlm: A lightweight vi- sion language model for online app control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18039","last_updated":"2025-05-23T15:42:52Z","snapshot_observed_at":"2026-08-09T21:49:58.371675Z","submitted_at":"2025-05-23T15:42:52Z","title":"Clip4Retrofit: Enabling Real-Time Image Labeling on Edge Devices via Cross-Architecture CLIP Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:14.313795Z"},"links":{"cited_paper":"/paper/2502.06395","citing_paper":"/paper/2505.18039"},"observation_digest":"sha256:61c8a1864533bf18ccb27612c0595879f3d62435776344fd87180dddf4b39aa8","observation_id":"b0e4e628-7917-40f9-bdbb-2c4c204ec583","resolution":{"observed_at":"2026-08-07T14:38:14.313795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06395","snapshot_observed_at":"2026-08-06T05:57:51.212487Z","title":"Appvlm: A lightweight vision language model for online app control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01057","last_updated":"2025-08-12T12:29:02Z","snapshot_observed_at":"2026-08-06T17:28:47.995101Z","submitted_at":"2025-08-01T20:16:04Z","title":"Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:57:51.212487Z"},"links":{"cited_paper":"/paper/2502.06395","citing_paper":"/paper/2508.01057"},"observation_digest":"sha256:71b36ce58c8f9c0a6d0ca53dc029682f6688ba916054ac0629b182ffee286dff","observation_id":"5a5c8f33-cef1-4817-a5ad-f9c83bf1db80","resolution":{"observed_at":"2026-08-06T05:57:51.212487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"cited_work":{"arxiv_id":"2502.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06395","snapshot_observed_at":"2026-07-03T12:28:07.426391Z","title":"AppVLM: A lightweight vision language model for online app control,","venue":null,"work_id":"39cb782a-5c18-4458-8bb3-d290738caa17","year":2025},"citing_paper":{"arxiv_id":"2606.12666","last_updated":"2026-06-16T03:15:00Z","snapshot_observed_at":"2026-07-30T01:01:38.589980Z","submitted_at":"2026-06-10T20:48:39Z","title":"CAPED: Context-Aware Privacy Exposure Defense for Mobile GUI Agents","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T09:00:10.153170Z"},"links":{"cited_paper":"/paper/2502.06395","citing_paper":"/paper/2606.12666"},"observation_digest":"sha256:7b106daa4138824eab4b3b2df1cb4d94d66d92e0f4e59bb3d59e2d6ecbc77f31","observation_id":"51a7cc26-1e39-40bb-bec4-b5ee4fcf1667","resolution":{"observed_at":"2026-07-03T12:28:07.427900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06395/citation-record","integrity":"/paper/2502.06395/integrity","json":"/paper/2502.06395/citation-record.json","paper":"/paper/2502.06395"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11896","last_updated":"2024-06-14T17:49:55Z","snapshot_observed_at":"2026-08-09T00:37:01.766934Z","submitted_at":"2024-06-14T17:49:55Z","title":"DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11896","snapshot_observed_at":"2026-08-08T15:37:54.519563Z","title":"Digirl: Training in-the-wild device- control agents with autonomous reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.519563Z"},"links":{"cited_paper":"/paper/2406.11896","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:91ced51b08d5a0d752c923da300d7dbc8de9b98b5dba0128789d0fc2bd3a851c","observation_id":"6ed1e4c6-d607-41d1-8886-8b337aed2a91","resolution":{"observed_at":"2026-08-08T15:37:54.519563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17883","last_updated":"2025-02-12T17:51:51Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T13:57:00Z","title":"Lightweight Neural App Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17883","snapshot_observed_at":"2026-08-08T15:37:54.528185Z","title":"Lightweight neural app control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.528185Z"},"links":{"cited_paper":"/paper/2410.17883","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:a6190c74181ee4fb1d0f6245d62e531f647170402636ce170a8d606bb0cc4f29","observation_id":"cd851a6e-a6c1-4d45-b8e3-856189ad2989","resolution":{"observed_at":"2026-08-08T15:37:54.528185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T15:37:54.531018Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.531018Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:cc4d6c906a3bc1044bffd8d493dc38c5a854d9325b93dd6eb7bc3e56f255d2bb","observation_id":"4a221bfc-1f01-4ac3-a7d4-1639a28e47bb","resolution":{"observed_at":"2026-08-08T15:37:54.531018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-08T15:37:54.533475Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.533475Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:c108a03c81fa5b744b4c2c7892cdb72047406627d9d3949b667e6250c3d850bb","observation_id":"5b6ada51-3de3-46ec-93dc-e2bb158981d8","resolution":{"observed_at":"2026-08-08T15:37:54.533475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-08T15:37:54.536153Z","title":"L., Srinivasan, S., Konyushkova, K., Weerts, L., Sharma, A., Siddhant, A., Ahern, A., Wang, M., Gu, C., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.536153Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:4e1355ed9dea1ecc5b6bbda7a0fbf17de316e9b5bae4dee877189d40116a8d35","observation_id":"a0ea285d-3614-4e41-b031-9782d3c546f9","resolution":{"observed_at":"2026-08-08T15:37:54.536153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T15:37:54.539177Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.539177Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:d2d3023616b0a4d1bc12d3cbf786eebc33596bb1ce62be12dfc68d5c959af982","observation_id":"a64e8fb3-0ca0-48fc-8015-5bcd6affba91","resolution":{"observed_at":"2026-08-08T15:37:54.539177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03679","last_updated":"2024-11-13T16:42:22Z","snapshot_observed_at":"2026-08-10T03:02:28.751528Z","submitted_at":"2024-06-06T01:49:29Z","title":"On the Effects of Data Scale on UI Control Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03679","snapshot_observed_at":"2026-08-08T15:37:54.541542Z","title":"On the effects of data scale on computer control agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.541542Z"},"links":{"cited_paper":"/paper/2406.03679","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:439d3948d6c7127b03bd9e1ebd53b1df2b2bd3e68ae26879af82f33a112f1da7","observation_id":"f24303b7-8340-460d-a445-784b53837d84","resolution":{"observed_at":"2026-08-08T15:37:54.541542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04575","last_updated":"2025-01-08T15:45:21Z","snapshot_observed_at":"2026-08-05T04:06:23.326388Z","submitted_at":"2025-01-08T15:45:21Z","title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04575","snapshot_observed_at":"2026-08-08T15:37:54.543920Z","title":"Infiguiagent: A multimodal generalist gui agent with native reasoning and reflection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.543920Z"},"links":{"cited_paper":"/paper/2501.04575","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:93a04514852d0812c98953959547b7653b706e5cf11c6d086843700df1473566","observation_id":"32d2670d-d139-48f4-ba6d-7df492d0e00c","resolution":{"observed_at":"2026-08-08T15:37:54.543920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-08T15:37:54.551325Z","title":"J., Sodhani, S., Jayaraman, D., Bastani, O., Kumar, V ., and Zhang, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.551325Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:32daa1d38c99178dab46f51bbfb492f02a95e90a72ade493301d69a7ddd98477","observation_id":"360c5b06-550d-4edd-a146-71873d76509d","resolution":{"observed_at":"2026-08-08T15:37:54.551325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-08T15:37:54.556214Z","title":"Androidworld: A dynamic benchmark- ing environment for autonomous agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.556214Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:7f55ed5d23fa1e4612e48a341839c37f198f43ad0c823127b79ddb7844ecf57f","observation_id":"f9820037-d614-4ddf-8003-194d051f96d0","resolution":{"observed_at":"2026-08-08T15:37:54.556214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18074","last_updated":"2025-03-23T13:04:57Z","snapshot_observed_at":"2026-07-06T18:06:36.637559Z","submitted_at":"2024-04-28T05:33:15Z","title":"MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18074","snapshot_observed_at":"2026-08-08T15:37:54.558584Z","title":"Mmac-copilot: Multi-modal agent collaboration operating system copilot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.558584Z"},"links":{"cited_paper":"/paper/2404.18074","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:047ba9c6d01068ba7d31d34fa2dae5f7a2dcb1aaf29a81960f750441bcc297a5","observation_id":"76720d38-d55a-48d9-ba04-617a07e69271","resolution":{"observed_at":"2026-08-08T15:37:54.558584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13231","last_updated":"2021-05-27T15:20:14Z","snapshot_observed_at":"2026-08-06T19:12:22.947026Z","submitted_at":"2021-05-27T15:20:14Z","title":"AndroidEnv: A Reinforcement Learning Platform for Android","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13231","snapshot_observed_at":"2026-08-08T15:37:54.560958Z","title":"Androidenv: A reinforcement learning platform for android","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.560958Z"},"links":{"cited_paper":"/paper/2105.13231","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:1d844d22ec0ed005411ffd6f13b5f3f242aaa825a3c30c92c43f312d7f281ca8","observation_id":"6b9f935c-9470-414e-8a55-ea3d691166ed","resolution":{"observed_at":"2026-08-08T15:37:54.560958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01268","last_updated":"2024-12-02T08:35:31Z","snapshot_observed_at":"2026-07-06T20:00:00.800207Z","submitted_at":"2024-12-02T08:35:31Z","title":"Ponder & Press: Advancing Visual GUI Agent towards General Computer Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01268","snapshot_observed_at":"2026-08-08T15:37:54.565635Z","title":"Ponder & press: Advancing visual gui agent towards general computer control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.565635Z"},"links":{"cited_paper":"/paper/2412.01268","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:16b5f79f1375b4f899333503053031a3dff758ebb99ca8f3392ba6b7e87ffe21","observation_id":"6bf42c5c-bae7-4caf-92cc-2a8266cf0e92","resolution":{"observed_at":"2026-08-08T15:37:54.565635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-08T15:37:54.570747Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.570747Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:3ea6f774e2af159a241591dac778368f6b0c8bcacc232f5f85ab673c507629fe","observation_id":"13fe7a9f-f2f4-4f23-9e93-bc7b17880995","resolution":{"observed_at":"2026-08-08T15:37:54.570747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-10T11:11:57.106246Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-08T15:37:54.568144Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.568144Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:1ee8fa1eca6ab72f5d56aa97989fba5994ad6452b16c3552728e716abeaf13f4","observation_id":"fab341d0-e979-4a63-ac26-f5c18a6f95e7","resolution":{"observed_at":"2026-08-08T15:37:54.568144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11941","last_updated":"2024-06-02T13:25:05Z","snapshot_observed_at":"2026-08-10T08:00:10.052589Z","submitted_at":"2024-02-19T08:29:03Z","title":"CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11941","snapshot_observed_at":"2026-08-08T15:37:54.548756Z","title":"Comprehensive cognitive llm agent for smartphone gui automation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.548756Z"},"links":{"cited_paper":"/paper/2402.11941","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:d4d044108e005980934d2b4a5679bcbe3fa430f2dc30f1e2f998264d34f762ca","observation_id":"86d18d76-1f97-429d-9bc1-b14c880830b6","resolution":{"observed_at":"2026-08-08T15:37:54.548756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01014","last_updated":"2024-06-03T05:50:00Z","snapshot_observed_at":"2026-08-09T00:41:49.528462Z","submitted_at":"2024-06-03T05:50:00Z","title":"Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01014","snapshot_observed_at":"2026-08-08T15:37:54.563322Z","title":"Mobile-agent-v2: Mobile device operation assistant with effective nav- igation via multi-agent collaboration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.563322Z"},"links":{"cited_paper":"/paper/2406.01014","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:2bdbff4ec4f4dfe2e2f3f779e166ca4be4b7d5d973610e29a4c50cb6426611ee","observation_id":"27b01f1a-5bc3-4131-99f1-6efb3355b439","resolution":{"observed_at":"2026-08-08T15:37:54.563322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-08T15:37:54.553747Z","title":"Agent q: Advanced reasoning and learning for autonomous ai agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.553747Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:893b43e6ecd2f66d1fd425628763a125fe13912a1dceee605ee3d675b5a55f01","observation_id":"e63cf0bd-b02b-400d-a4f1-cdc5d3c93ae9","resolution":{"observed_at":"2026-08-08T15:37:54.553747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:37:54.767721Z","title":"Spa-bench: A comprehensive benchmark for smartphone agent evalu- ation","venue":null,"work_id":"a56f725f-3f9a-4153-866a-83cb6b368b1d","year":2024},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.525776Z"},"links":{"citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:fea63d2a45800a409a353eee46c8e1eb064b0f1b737e0be10f5af96bce83eafd","observation_id":"f05f1e6f-53b3-4ac6-bffa-15d336ba23ce","resolution":{"observed_at":"2026-08-08T15:37:54.772501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-08T15:37:54.522979Z","title":"S., Kolesnikov, A., Wang, X., Salz, D., Neumann, M., Alabdulmohsin, I., Tschan- nen, M., Bugliarello, E., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.522979Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:a102bed3fa09a7e3213aafde8176a408b1219eb9bf2455219723aa429548d677","observation_id":"4ffa1ec5-4963-4444-a1ca-c1d71a5580c2","resolution":{"observed_at":"2026-08-08T15:37:54.522979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T15:37:54.546326Z","title":"Fixing weight decay regu- larization in adam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T15:37:54.546326Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.06395"},"observation_digest":"sha256:7f0c81e800f1ad98b11f393db2c0314edffba69961662e0b1d5248aff8a42c7e","observation_id":"871a86d5-f1ff-4633-99a1-a069738803de","resolution":{"observed_at":"2026-08-08T15:37:54.546326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06395","last_updated":"2025-02-10T12:32:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T00:37:17.908179Z","submitted_at":"2025-02-10T12:32:21Z","title":"AppVLM: A Lightweight Vision Language Model for Online App Control"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 4 inbound Pith citation observations for arXiv:2502.06395."}