{"as_of":"2026-08-10T11:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1f385373c62b0d0cd189c9ccf016d5380b3ffc291fab6ffc3589380bc3b6968","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:44:51.870568Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23491/citation-record","integrity":"/paper/2506.23491/integrity","json":"/paper/2506.23491/citation-record.json","paper":"/paper/2506.23491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:44:50.843200Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:50.843200Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:b1f5a8d4135169fc5c536518ff4da4965b0fbe189d91e9a6e1a71f4fee84ce0c","observation_id":"992594d9-e92b-4bc9-97ea-9ebde3e7b141","resolution":{"observed_at":"2026-08-06T21:44:50.843200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-06T21:44:50.910470Z","title":"Amex: Android multi-annotation expo dataset for mobile gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:50.910470Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:4ac6ef5c820b280c1f260f1ec613c32675f70a9b1f7ca860e2d40b365b47c8a1","observation_id":"4324f7a0-8bdd-4710-b96e-c080e1e20730","resolution":{"observed_at":"2026-08-06T21:44:50.910470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-06T21:44:51.037486Z","title":"Seeclick: Har- nessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.037486Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:2d35d3c69c98fa275078d4d527500b57e4c33f6703fa02dbb04e0e2390d4a209","observation_id":"6e7e588f-5aa1-4c2b-95f4-f77288f202db","resolution":{"observed_at":"2026-08-06T21:44:51.037486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-06T21:44:51.133054Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.133054Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:6559993801e037677dd8b52e5f3c0ce07c75fc6bd62413b45d7cb217fc9c67b7","observation_id":"10bf4088-d97f-444f-af54-c6f7aa581c79","resolution":{"observed_at":"2026-08-06T21:44:51.133054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T21:44:51.212777Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.212777Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:711feff6b1a6265530fdc896e07795cd42a4823f09fb83b4e2244e367eec317f","observation_id":"cc4f8ab6-75d4-4a7d-bf8b-aa198f685dbe","resolution":{"observed_at":"2026-08-06T21:44:51.212777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T21:44:51.300123Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.300123Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:18920043e166233e068a3ab910abb4fab1fe5d1e418077d473e6f87f485ade34","observation_id":"943b2969-9783-4047-8f10-92d7dd04fe24","resolution":{"observed_at":"2026-08-06T21:44:51.300123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07981","last_updated":"2025-04-04T14:25:17Z","snapshot_observed_at":"2026-08-07T16:08:52.673312Z","submitted_at":"2025-04-04T14:25:17Z","title":"ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07981","snapshot_observed_at":"2026-08-06T21:44:51.404442Z","title":"Screenspot-pro: Gui grounding for professional high- resolution computer use","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.404442Z"},"links":{"cited_paper":"/paper/2504.07981","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:35fe15ac0274f67b5bae8fc7b6a8e9c59a3d82a6a71455a38bc2e74cb66e78eb","observation_id":"e3cbe5b5-0cc5-473a-8312-81e95ddd2e71","resolution":{"observed_at":"2026-08-06T21:44:51.404442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-08-10T11:30:41.419025Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T21:44:51.512452Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.512452Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:6d03c2937e08ebbd14aba61b57d032ffe4d3ff9c5db35e693ebd9349e757ff64","observation_id":"44f450de-7495-43d0-9caa-5f74dfb736c0","resolution":{"observed_at":"2026-08-06T21:44:51.512452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-06T21:44:51.637524Z","title":"Ui-tars: Pioneering automated gui inter- action with native agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.637524Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:2804a9c36ed01775c54127b2023bb4a246667008aba7670a02655bc80015ca49","observation_id":"5db9d50c-133d-4525-9eb1-e66ec95fc4c8","resolution":{"observed_at":"2026-08-06T21:44:51.637524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-06T21:44:51.722301Z","title":"Os-atlas: A founda- tion action model for generalist gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.722301Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:9b393e82e81b13cfb871d8b978b11069547b76b8e540f72420db2cc7a91dec89","observation_id":"1df72db2-919b-4610-876e-e429fe62d5e5","resolution":{"observed_at":"2026-08-06T21:44:51.722301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-06T21:44:51.798796Z","title":"Aguvis: Unified pure vision agents for autonomous gui interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.798796Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:ad8c19493c14d58df829619027ef1c834417c005ea9795b10dcf15a08c71ba48","observation_id":"ffa7ece6-be0e-4642-ae6d-871d955bb696","resolution":{"observed_at":"2026-08-06T21:44:51.798796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:44:51.870568Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.870568Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:66fe8c380aab4cfe2cabfba694c58b85270c57e8a00dbd661e9561040f3352fe","observation_id":"30a0a296-4d0d-4cc7-8987-ab2dfd049432","resolution":{"observed_at":"2026-08-06T21:44:51.870568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2506.23491."}