{"as_of":"2026-08-21T08:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63203e280d147ef38ad56c50bee594c4553b349b69851d298a438b1252c1a3c5","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:27:24.411116Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T14:24:48.938948Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T14:27:24.320785Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"cited_work":{"arxiv_id":"2507.05673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-vlm: Region-aware vision language model for precise gui grounding","venue":null,"work_id":"d108dbb4-37e5-440a-bcc1-232249f00fe1","year":2025},"citing_paper":{"arxiv_id":"2605.06664","last_updated":"2026-05-07T17:59:31Z","snapshot_observed_at":"2026-08-20T07:29:30.054654Z","submitted_at":"2026-05-07T17:59:31Z","title":"BAMI: Training-Free Bias Mitigation in GUI Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T12:20:42.718277Z"},"links":{"cited_paper":"/paper/2507.05673","citing_paper":"/paper/2605.06664"},"observation_digest":"sha256:cb4bfc105d2f9d89de6213891a528996c200bf2ef84b82d806e33d6835a76dc3","observation_id":"53b33f13-a7e0-4af3-b7ba-6800a7abb538","resolution":{"observed_at":"2026-05-11T19:16:10.135986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"cited_work":{"arxiv_id":"2507.05673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R-vlm: Region-aware vision language model for precise gui grounding","venue":null,"work_id":"d108dbb4-37e5-440a-bcc1-232249f00fe1","year":2025},"citing_paper":{"arxiv_id":"2605.15542","last_updated":"2026-05-15T02:27:41Z","snapshot_observed_at":"2026-08-01T22:59:27.797060Z","submitted_at":"2026-05-15T02:27:41Z","title":"DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T14:24:48.938948Z"},"links":{"cited_paper":"/paper/2507.05673","citing_paper":"/paper/2605.15542"},"observation_digest":"sha256:a8968705c17a564dffc62dbafdb789aa075b87d8abeb43926ed8f606a5d42267","observation_id":"22f79aca-1484-4f11-9baf-260f110ea114","resolution":{"observed_at":"2026-05-19T14:27:24.323399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05673/citation-record","integrity":"/paper/2507.05673/integrity","json":"/paper/2507.05673/citation-record.json","paper":"/paper/2507.05673"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:27:24.212735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.212735Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:21bebb922ab3e8ae4c8225ae25dfbb594d4bf4a178949bd69db317f9d77d38cf","observation_id":"b11696a9-f229-41bf-9796-3b06c51ca008","resolution":{"observed_at":"2026-08-06T19:27:24.212735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:27:24.218897Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.218897Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:5256f23139e0b55fe0128ae6e13a0ccc8fc8a55bc8445d818438ca8f4f9b9729","observation_id":"ea599908-8907-4dca-8505-f3669f4b8432","resolution":{"observed_at":"2026-08-06T19:27:24.218897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.224150Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.224150Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:7c75bb911f206ab541a884141b2284cf773ceb1e1bef6ea857d96931df0a234f","observation_id":"cfb5238d-3181-438e-bf97-f4684832be4a","resolution":{"observed_at":"2026-08-06T19:27:24.224150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:25.046811Z","title":null,"venue":null,"work_id":"5f24ee10-6252-40cc-86b5-3c6c3c1ebfb9","year":2022},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.229639Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:0ada430ab2006d324ac622d41521793c2eb80daf6e1a5945eefd1fd5935d72c8","observation_id":"dda9be68-2083-447e-882c-f602fa44f548","resolution":{"observed_at":"2026-08-06T19:27:25.051971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:25.028688Z","title":null,"venue":null,"work_id":"597b1698-9ee6-4a61-8740-ce0dd0306709","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.235829Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:f4b8d8fe70ade3d0aa9068ad3c22c7aaf5e9410f9daed0ec8bab405c7ba7090b","observation_id":"735c04a1-b202-45d7-bef8-c182ce1024cc","resolution":{"observed_at":"2026-08-06T19:27:25.034436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.241420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.241420Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:4c11a2e567e87028b18336d49e46e2ec9443dfd1f5fbab21480184481f7c06fa","observation_id":"feb118dc-d6c3-4f77-8c56-8f42b185b65d","resolution":{"observed_at":"2026-08-06T19:27:24.241420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.997891Z","title":null,"venue":null,"work_id":"72ea6ab3-ed3b-4408-ab1b-60114af1af8d","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.247498Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:582fece33f95a414a41e97e992ddd989a4524ef8835ed5fc4e32ed7732210748","observation_id":"48cedb75-8d1a-4cb2-a7da-4f1a98d7c6f9","resolution":{"observed_at":"2026-08-06T19:27:25.003225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13108","last_updated":"2024-01-01T14:26:39Z","snapshot_observed_at":"2026-08-20T11:28:56.553116Z","submitted_at":"2023-12-20T15:28:38Z","title":"ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13108","snapshot_observed_at":"2026-08-06T19:27:24.252097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.252097Z"},"links":{"cited_paper":"/paper/2312.13108","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:b2304142300abb2f53b602b8021c9daa5063dd6916e422622c1bb632966c57d3","observation_id":"10b439b8-16b2-47e4-830d-d7e89eae4eb5","resolution":{"observed_at":"2026-08-06T19:27:24.252097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.257232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.257232Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:78ea2f5980fe511b50640fae2231e3810914d3ccddb0240225100bf1f8145d9d","observation_id":"35d112e1-37a3-49af-8195-51200545f2d4","resolution":{"observed_at":"2026-08-06T19:27:24.257232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.08083","last_updated":"2015-09-27T15:10:14Z","snapshot_observed_at":"2026-08-16T10:49:25.957908Z","submitted_at":"2015-04-30T05:13:08Z","title":"Fast R-CNN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.08083","snapshot_observed_at":"2026-08-06T19:27:24.262142Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.262142Z"},"links":{"cited_paper":"/paper/1504.08083","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:08b7d7c6a49068be9fc9ce75e1b51ed2bf8d53ad5b255ab8c4f6fd54109f928a","observation_id":"75cbf0a1-6094-4e83-887d-ecf61b755617","resolution":{"observed_at":"2026-08-06T19:27:24.262142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.967749Z","title":null,"venue":null,"work_id":"7e01bceb-ca3a-494e-b0a4-b1e1adfdad24","year":2014},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.267199Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:6a2c84fd07728fb960c6642c0e9da4e2d66ad9c375346a3d8bcab29e61fb7089","observation_id":"63c08db3-3a34-4587-9f8c-193de7897f46","resolution":{"observed_at":"2026-08-06T19:27:24.973013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.951622Z","title":null,"venue":null,"work_id":"d09cab4a-03c1-4eb7-b5da-0b8bd1ac5f80","year":2025},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.272772Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:be8ce6229a0bd1ee88c0f060479a25d3983241351a0eca38e059087ddbff80fc","observation_id":"276b7c5f-f2da-4034-bed4-f0e9e97c2d14","resolution":{"observed_at":"2026-08-06T19:27:24.956555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.935330Z","title":null,"venue":null,"work_id":"55913454-b99f-4844-ab89-1f05d40a682b","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.277902Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:9dc57cf71989a706484851344b30b617b4c65428d046d6a220b6ca005e364c22","observation_id":"3f9e9c18-4adf-4f68-af3d-cfebe1dce810","resolution":{"observed_at":"2026-08-06T19:27:24.940575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-15T01:23:25.524198Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-06T19:27:24.283142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.283142Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:56f49e1e17a0695e385b08a265c6d45b5a91f48977c690133cb59c0b0d612c0c","observation_id":"6ff302a5-700c-4ddd-a218-2f5bde6350a2","resolution":{"observed_at":"2026-08-06T19:27:24.283142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.918933Z","title":null,"venue":null,"work_id":"f00489e3-12c8-42ef-bfd9-aa8c45da8f63","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.288554Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:27d3d23a383d06560b6ccfabced4961fc523babb2e6f1b53e93fcc8451050e4a","observation_id":"e2b2a860-7b18-45cb-926e-31bc46cada4a","resolution":{"observed_at":"2026-08-06T19:27:24.923855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.293943Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.293943Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:af681fbc5baf75bfe51be5ca2e84f1e70c2bfac4de89394a4e05b568137dae1d","observation_id":"c0be1938-6bc9-4572-b06e-cf80fb2b0fc6","resolution":{"observed_at":"2026-08-06T19:27:24.293943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17553","last_updated":"2024-07-21T23:16:13Z","snapshot_observed_at":"2026-08-18T08:54:28.082551Z","submitted_at":"2024-02-27T14:47:53Z","title":"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17553","snapshot_observed_at":"2026-08-06T19:27:24.299572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.299572Z"},"links":{"cited_paper":"/paper/2402.17553","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:946a1ffeec61d1620312cc5d406e625bde58b1474f2c1179adc0f79139a9962f","observation_id":"a947842b-a14b-4ed0-8147-35ba94124eb5","resolution":{"observed_at":"2026-08-06T19:27:24.299572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.304727Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.304727Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:439b74082cf3882e2f7e1f831ddac18d0bd25809896d06d242a6ac3bfeeb0988","observation_id":"b219ece9-c2af-4596-adde-93cbe84df7f8","resolution":{"observed_at":"2026-08-06T19:27:24.304727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.878027Z","title":null,"venue":null,"work_id":"b99b6773-4dbc-44fe-9eae-566c0bcd3c70","year":2016},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.309870Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:557e32fe31238cddb13d2fed148cccafb218b7cbe55285868db0496834a8a433","observation_id":"17a058b4-165a-412c-9f3a-041b385c2bde","resolution":{"observed_at":"2026-08-06T19:27:24.883379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T19:27:24.315672Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.315672Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:bffe0057cb7aba07a1ac09f934ba7252f3528f0412a204c04edf4f2643dea83a","observation_id":"fbaa090f-817a-49f3-8b7b-b5c1508350b3","resolution":{"observed_at":"2026-08-06T19:27:24.315672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03432","last_updated":"2023-02-07T12:36:35Z","snapshot_observed_at":"2026-08-20T08:07:17.815861Z","submitted_at":"2023-02-07T12:36:35Z","title":"SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2302.03432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03432","snapshot_observed_at":"2026-08-06T19:27:24.524307Z","title":"SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation","venue":"cs.CV","work_id":"cf53dd93-3848-4404-a201-de7ac934c68f","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.320886Z"},"links":{"cited_paper":"/paper/2302.03432","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:5e9d92a9df8d337eb58c7e7416a96a15f3844730c332e401c1339de5d1cd254f","observation_id":"0c71ca54-07d1-4ae9-9208-bf4ed2964856","resolution":{"observed_at":"2026-08-06T19:27:24.532162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.859561Z","title":null,"venue":null,"work_id":"cbf51473-2060-4b67-bcbb-3f5d6b9b943f","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.326696Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:94a69232463ff46564a35677006dfe26ed97b8c42e1962fab6dd2f013771db3b","observation_id":"25748ec8-d0ed-4ec8-90d6-f76e2f8e7a44","resolution":{"observed_at":"2026-08-06T19:27:24.865131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.840818Z","title":null,"venue":null,"work_id":"7ecd5872-01ad-4775-8919-8171eded4292","year":2016},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.332396Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:455435fd0bf5f7845f0d0ce657879a411a1782283b068c94a04062e669e499c7","observation_id":"e2c4afd2-b22f-4f25-8d06-8bbefc3e5711","resolution":{"observed_at":"2026-08-06T19:27:24.846905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.822553Z","title":null,"venue":null,"work_id":"c35310cd-f53f-4c0f-8d20-2163e9c70e2a","year":2019},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.337540Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:c5f0900cd54bf9c5bef3a95ec023f6e391a9611f7bad339bf1cd618297f0e3be","observation_id":"3a5e9143-37bf-4bbc-9f4e-7179113eb47a","resolution":{"observed_at":"2026-08-06T19:27:24.828189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.805239Z","title":null,"venue":null,"work_id":"d2fc8031-3734-436b-9e0b-5c94bce778e1","year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.343146Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:f4aa9472b6a053c34d7feff1749fb3f91107e665d0f5f968d0a8e760868b8458","observation_id":"9d0aa4d6-f452-413e-a072-f397d1aca5bf","resolution":{"observed_at":"2026-08-06T19:27:24.810918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-08-15T05:00:23.895770Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-06T19:27:24.348097Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.348097Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:42cdcb51300302a270857e62cc6f3e7618f8d870dfb2cdf04711460782f80022","observation_id":"c20fc2dd-7c26-493e-86bf-47179cab3c62","resolution":{"observed_at":"2026-08-06T19:27:24.348097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.353074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.353074Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:612de0d60c49266d93c67d6022ef9287365b45a943bf21b45ca65ffa95fd9307","observation_id":"9c14735c-94a5-4c62-8db0-a0738b40d152","resolution":{"observed_at":"2026-08-06T19:27:24.353074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.775032Z","title":null,"venue":null,"work_id":"929e2ecd-2ae1-499a-955b-300e919fe669","year":2013},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.358476Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:74f25dc7186c3730ad1f1e2daf7efeaa56072a8671a620302d836c5b8064527d","observation_id":"4eb04b6c-2332-4a3f-b2cf-ab92b7ac183d","resolution":{"observed_at":"2026-08-06T19:27:24.781317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.755665Z","title":null,"venue":null,"work_id":"01a55119-4acb-489b-880e-4fdd310e529d","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.364462Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:e5598055a49fe1ef3c8d8d7926abf6b215afea06f849a9852299e87efde258c3","observation_id":"dc832ccf-2fa6-44b3-b3ed-8db6b69a42d4","resolution":{"observed_at":"2026-08-06T19:27:24.761739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11436","last_updated":"2024-06-07T04:52:29Z","snapshot_observed_at":"2026-08-20T03:55:01.596724Z","submitted_at":"2023-09-20T16:12:32Z","title":"You Only Look at Screens: Multimodal Chain-of-Action Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11436","snapshot_observed_at":"2026-08-06T19:27:24.370000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.370000Z"},"links":{"cited_paper":"/paper/2309.11436","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:34295c4701422cd49908dd246277c3301b0d49a341a360d55816773d5afa8c96","observation_id":"83061e98-a732-44e5-8b0d-5b14b60cb24a","resolution":{"observed_at":"2026-08-06T19:27:24.370000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-08-13T20:16:41.272728Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-06T19:27:24.375110Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.375110Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:edb13c5d598c3509ad71f129a97fe74f67418e9a95386a61b1bb9c452e0025f7","observation_id":"dcb16118-a6f4-40b0-97c6-cbdcddd5e6d0","resolution":{"observed_at":"2026-08-06T19:27:24.375110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.737887Z","title":null,"venue":null,"work_id":"1b30584e-c9e8-4d9b-a194-4326f0171f31","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.379963Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:4b69d34e13978c9280fe09e0be7e2623c924ab32ce9eeb2f7aa2a0975d8dfdba","observation_id":"442eedfe-ccec-4258-b0b9-1b30644a7616","resolution":{"observed_at":"2026-08-06T19:27:24.743586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17918","last_updated":"2025-02-14T08:13:39Z","snapshot_observed_at":"2026-08-19T05:46:03.962201Z","submitted_at":"2024-03-26T17:54:15Z","title":"AgentStudio: A Toolkit for Building General Virtual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17918","snapshot_observed_at":"2026-08-06T19:27:24.385204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.385204Z"},"links":{"cited_paper":"/paper/2403.17918","citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:fcd02f13888574011e5da2b2331f464990aa15ab57d13b52ddb195104fa39cb9","observation_id":"49cf1bcf-c013-4949-9e04-c522406f976c","resolution":{"observed_at":"2026-08-06T19:27:24.385204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.720420Z","title":null,"venue":null,"work_id":"fa4e8e2e-789f-44dc-9bc9-68c3eb3de58c","year":2024},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.390134Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:e559c349ce13a94d0f82fb0c8d6205761ab16220e74c9af9248ae9b8f08a7998","observation_id":"f1dd36eb-7289-4d88-a64b-1f410fae661a","resolution":{"observed_at":"2026-08-06T19:27:24.725332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.703003Z","title":null,"venue":null,"work_id":"be35ecee-8a32-410e-bf7c-1ca5f9e203fa","year":2025},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.394991Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:af002ec6d94fa8dd7d4a9c30f6a918ca486ef8b855937e91d64bb032428bba43","observation_id":"984713c1-71fd-4899-8621-ea70afe44b03","resolution":{"observed_at":"2026-08-06T19:27:24.708939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.686577Z","title":null,"venue":null,"work_id":"0aa33b93-4ac6-4bdc-a259-1bf75d44a949","year":2014},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.399973Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:6eb3619a2e51464c103d45148f626e211dc5b9eb0b718be25e896554b1a3f6ca","observation_id":"d02d0340-1b12-4b81-aded-69b90d337191","resolution":{"observed_at":"2026-08-06T19:27:24.691713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.405903Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.405903Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:da17ba748f9a9de9e0469d42af4b47ec005443cd6d32c6293d9414c355c3ae93","observation_id":"987e571c-f5c3-4a20-9dbd-d040f008a2cb","resolution":{"observed_at":"2026-08-06T19:27:24.405903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:27:24.411116Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:27:24.411116Z"},"links":{"citing_paper":"/paper/2507.05673"},"observation_digest":"sha256:077bd408d7a48988a9b08461e2caa8b2a8978d4a9c889a60bfc5204238dbe2ca","observation_id":"09dce4fa-b1d5-4fb6-b51d-ba1a9cf5c44d","resolution":{"observed_at":"2026-08-06T19:27:24.411116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05673","last_updated":"2025-07-08T04:56:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:34:32.939758Z","submitted_at":"2025-07-08T04:56:57Z","title":"R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2507.05673."}