{"as_of":"2026-08-10T03:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:509f37b19a76aaa54635563edf0258d15bb061432ad05150d36c31e2e46aae1c","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:51:33.440332Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:51:31.716332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.11548","snapshot_observed_at":"2026-08-04T16:51:31.716332Z","title":"Beyond identification, this task requires the model to output precise screen coordinates, such as a click point or a bounding box","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.716332Z"},"links":{"cited_paper":"/paper/2509.11548","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:c84c25e4159f0187ba1ae580ee444e151e2022b31b0c7fe4f8cecaa27e07654c","observation_id":"f1101802-b286-4e4e-8bcc-225efeea8580","resolution":{"observed_at":"2026-08-04T16:51:31.716332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.11548/citation-record","integrity":"/paper/2509.11548/integrity","json":"/paper/2509.11548/citation-record.json","paper":"/paper/2509.11548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.11548","snapshot_observed_at":"2026-08-04T16:51:31.716332Z","title":"Beyond identification, this task requires the model to output precise screen coordinates, such as a click point or a bounding box","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.716332Z"},"links":{"cited_paper":"/paper/2509.11548","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:c84c25e4159f0187ba1ae580ee444e151e2022b31b0c7fe4f8cecaa27e07654c","observation_id":"f1101802-b286-4e4e-8bcc-225efeea8580","resolution":{"observed_at":"2026-08-04T16:51:31.716332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:31.769371Z","title":"Where should I click if I want to {instruction}?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.769371Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:659f5f449a065e757caa07897e569775a60e0e6c597c4635a9bbce37f347531a","observation_id":"2428adad-0aa2-4f21-88b5-b0e31044ed98","resolution":{"observed_at":"2026-08-04T16:51:31.769371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:31.809828Z","title":"Experimental Settings This section describes the experimental setup used to evaluate the performance of our proposed auxiliary reasoning methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.809828Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:b4d9961112bb9366b4bc1d0dd538bcde92dc3d9a2f9c92a8266bdf9a05d5cc19","observation_id":"412adee4-5d9d-42c6-8645-788840c97b6b","resolution":{"observed_at":"2026-08-04T16:51:31.809828Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:31.890936Z","title":"The diagnostic Pointing Game demonstrates this gap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.890936Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:7bda07d8fce0c9ab497ce9b07f58a2cdd1bf48c5531f63efbf3546c93b715663","observation_id":"02424194-7d15-411d-bfa6-b1394d5e5ca1","resolution":{"observed_at":"2026-08-04T16:51:31.890936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T16:51:31.949951Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.949951Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:1f4222b0b7134476a1eed132a645ba281cebc4e5f180ecf428e92af218ddd36e","observation_id":"780ac4a7-fdd2-459a-a009-5d8409dda7df","resolution":{"observed_at":"2026-08-04T16:51:31.949951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.032520Z","title":"SeeClick: Harnessing GUI grounding for advanced visual GUI agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.032520Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:d73851a5195d1022f8bb7dd6b57fbece32a39c15990da4d8888e28232eacea19","observation_id":"d71daf8c-24dc-4c0d-b67e-d8ed677eec67","resolution":{"observed_at":"2026-08-04T16:51:32.032520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.055900Z","title":"OS-ATLAS: Foundation action model for generalist GUI agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.055900Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:4e43d4d6a5a34c99db0529bb266ce6055b1394aeab96dc73cf5782ec24cc9296","observation_id":"11cbf6c6-5bed-48af-a86c-32a122bcc91b","resolution":{"observed_at":"2026-08-04T16:51:32.055900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.117327Z","title":"Screenspot-pro: GUI grounding for professional high- resolution computer use,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.117327Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:6bf0dabe01fd9d223fc4b49be9066ef25ac2e144ea31786eb7d32502c5345ede","observation_id":"0d190fd9-ee5e-46ca-947b-3f7424ffee1e","resolution":{"observed_at":"2026-08-04T16:51:32.117327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.199486Z","title":"Top-down neural attention by excitation backprop,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.199486Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:4410a1b1c38af5b051409b02328d52a648964120e507e6a45b3277ffa0654fc2","observation_id":"4a261981-b3ab-4e36-a744-1a7cc546e397","resolution":{"observed_at":"2026-08-04T16:51:32.199486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.256010Z","title":"Navigating the digital world as humans do: Universal visual grounding for GUI agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.256010Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:a9cf4b20e9346bc8e5c4463be5df22f14028dbe1b6d6b91b1ae293a60855353c","observation_id":"ab93901b-9904-4571-8189-143943588ccc","resolution":{"observed_at":"2026-08-04T16:51:32.256010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.284001Z","title":"Aguvis: Unified pure vision agents for autonomous GUI in- teraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.284001Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:a352997279e092a957b9b4317ef886700817462b30144cb1821dd3570972b4b3","observation_id":"5e057f7c-ab59-4f52-ad4f-80b954bf2456","resolution":{"observed_at":"2026-08-04T16:51:32.284001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.336815Z","title":"Cogagent: A visual language model for gui agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.336815Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:f3b61281b354e949630c4747575bc218ccf86025422ec4f915af58f1f635389d","observation_id":"198c0156-8a34-40d8-92b5-625df90de3fa","resolution":{"observed_at":"2026-08-04T16:51:32.336815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.387650Z","title":"Omniparser: A unified framework for text spotting key infor- mation extraction and table recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.387650Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:4f3ff7e1a6b8b7c3924bfc9eba7be3b7cd320ce35d9035b4b30a7aaef2713774","observation_id":"d08b44be-6604-46e0-acd8-23f6afdb4b91","resolution":{"observed_at":"2026-08-04T16:51:32.387650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-09T07:32:12.903499Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03143","snapshot_observed_at":"2026-08-04T16:51:32.441413Z","title":"Gui-actor: Coordinate-free visual ground- ing for gui agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.441413Z"},"links":{"cited_paper":"/paper/2506.03143","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:9e4306b2109f0681eaa6bd5b1e81aff5a7cce3e8500d9f9072e962e3a3ea8b3f","observation_id":"6a07ede7-d4fd-40a8-9fce-230268243ef8","resolution":{"observed_at":"2026-08-04T16:51:32.441413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.499728Z","title":"Infigui-g1: Advancing gui grounding with adaptive exploration policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.499728Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:704aae13e82d97efb564f702bab701128510d0d62436cdfdf485ce926975df38","observation_id":"6d1bdc93-c6ff-4d8b-b81d-9dd8d23006fe","resolution":{"observed_at":"2026-08-04T16:51:32.499728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-09T17:01:10.305047Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-04T16:51:32.578220Z","title":"Iris: Breaking gui complexity with adap- tive focus and self-refining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.578220Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:acaaf4b74b7f42e0cff9b2ecba4e23751c2f384f825a1a2308f7c9a3b5a3d496","observation_id":"5c57e7fd-9a60-4885-8155-74ba7bfae981","resolution":{"observed_at":"2026-08-04T16:51:32.578220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18270","last_updated":"2024-12-03T16:26:18Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:05:34Z","title":"Grid-augmented vision: A simple yet effective approach for enhanced spatial understanding in multi-modal agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18270","snapshot_observed_at":"2026-08-04T16:51:32.663520Z","title":"Grid-augmented vision: A simple yet effective approach for enhanced spatial understanding in multi-modal agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.663520Z"},"links":{"cited_paper":"/paper/2411.18270","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:6c6e1a15769ac44bee422d9048dac13a6e494d8e537da30c9745dd2c84699deb","observation_id":"958a67cc-ee55-4b13-9a38-8bf77d5d972b","resolution":{"observed_at":"2026-08-04T16:51:32.663520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.772908Z","title":"Scaffolding coordinates to promote vision-language co- ordination in large multi-modal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.772908Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:b24da3d9b8ac35d538137060cd0eabb4bc0861fdef481ddd5efcf4cd141f5d53","observation_id":"f2cc5ffa-b2ac-4b6f-8771-2e8474cbd2ed","resolution":{"observed_at":"2026-08-04T16:51:32.772908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.830662Z","title":"Attention-driven gui grounding: Leveraging pretrained multi- modal large language models without fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.830662Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:e2b680966f404974410870caeeb3d56cc1581aafb595f21e0986c52cf6600eb3","observation_id":"ace21c35-5769-4e61-99e4-d1fff20f92bb","resolution":{"observed_at":"2026-08-04T16:51:32.830662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13591","last_updated":"2025-09-11T16:37:00Z","snapshot_observed_at":"2026-07-06T19:53:21.444233Z","submitted_at":"2024-11-18T05:47:12Z","title":"Improved GUI Grounding via Iterative Narrowing","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13591","snapshot_observed_at":"2026-08-04T16:51:32.915416Z","title":"Improved gui grounding via iterative nar- rowing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.915416Z"},"links":{"cited_paper":"/paper/2411.13591","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:fe9bf4744938c82f9ba9c95cc135481a1ba4c3e1f3854b5bc50997c07a62648e","observation_id":"dbd3589e-1b4a-47b8-8661-d1625fc818f6","resolution":{"observed_at":"2026-08-04T16:51:32.915416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15259","last_updated":"2025-05-24T15:08:35Z","snapshot_observed_at":"2026-08-09T10:59:49.164484Z","submitted_at":"2025-05-21T08:36:18Z","title":"ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15259","snapshot_observed_at":"2026-08-04T16:51:33.016798Z","title":"Reguide: Data efficient gui grounding via spatial reasoning and search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.016798Z"},"links":{"cited_paper":"/paper/2505.15259","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:587bdd3decf9f3eb7a9e42213639e5ceb86191712ac00cbc1fd137a88c1f8c81","observation_id":"c34960f7-0e94-4a7a-874c-94a8ed0359f3","resolution":{"observed_at":"2026-08-04T16:51:33.016798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.089323Z","title":"Grounded language- image pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.089323Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:358c290094a40628f11c388878bb128659b27abea1d79867b5bee62ad3ee2d9e","observation_id":"0ce5746b-98f1-427c-99b4-4d10db173a51","resolution":{"observed_at":"2026-08-04T16:51:33.089323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.130872Z","title":"Ui-e2i- synth: Advancing gui grounding with large-scale instruction synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.130872Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:56e40814ef9a244153f15826a35250168873e7e34fb7c833d2cf554785111fbb","observation_id":"225d51dd-681c-48f8-bd05-c758b3e3f37a","resolution":{"observed_at":"2026-08-04T16:51:33.130872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T16:51:33.182317Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long con- text, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.182317Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:31e6a82d9a49de28f6d9d5a87030829ba84d08552409611dd5f3bdf9c17bed71","observation_id":"f99482e0-c06a-47f2-bdf3-0bf0605935da","resolution":{"observed_at":"2026-08-04T16:51:33.182317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.235657Z","title":"The claude 3 model family: Opus, Sonnet, Haiku,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.235657Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:886e0fe54651e615a99d8b10ff7068fcbf7b8854d816ef1c1b3c7b4684d8018a","observation_id":"3ba0d6a7-87cd-479e-b954-4a65e76b6966","resolution":{"observed_at":"2026-08-04T16:51:33.235657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T16:51:33.313941Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.313941Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:af60bc2002e0e918d23bee96e9c90d398df4a9b96a8e95e47921daa10365f974","observation_id":"8d2f4abd-5bc7-4a86-bc69-b60ac2840bf9","resolution":{"observed_at":"2026-08-04T16:51:33.313941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-04T16:51:33.366687Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.366687Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:d7c24f522c2acec13e494edf4c8fe585d31df3e0334f4264e2d24e48fe696c3e","observation_id":"08b35da1-3b4b-4926-ad3a-ef55bcd7cbe3","resolution":{"observed_at":"2026-08-04T16:51:33.366687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.440332Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.440332Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:46bf8481b0e66f7e59066cd2ab14fd5f87ea419625f2a0020b9841f571c69aa8","observation_id":"fea7b066-9552-46a2-8f11-bfa9cead366c","resolution":{"observed_at":"2026-08-04T16:51:33.440332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:06:40.548225Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2509.11548."}