{"as_of":"2026-08-10T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6ed96383d55471641c286338b839b84f63274aee56b99e8d548945ad00187d8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:25:55.669886Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:e8c80eab6d10cd643199db18313155117b97f4cb0ab8a1cbf9870832d8f6499b","observation_id":"3214e3ab-a280-41cf-8dbd-7e197a925c31","resolution":{"observed_at":"2026-05-16T02:56:42.446292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-17T10:09:46.447508Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2401.10935"},"observation_digest":"sha256:5222b6584e6ef2ddbd958e67ffa48dd6a74ff7c7db10234bebf6b56517fa1352","observation_id":"e6675e01-5d8a-410e-83a4-978dd5e5611e","resolution":{"observed_at":"2026-05-17T10:09:46.540356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-09T01:39:11.956106Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:e10187f6791aa0e7c3d606a9a1f9c21744a840931206630ce28108185e36863b","observation_id":"639bd103-164a-48a4-bd0d-82cbf0daa853","resolution":{"observed_at":"2026-05-13T01:19:32.465423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:efbfafaadf1212ab2860d0238a27b2a7559d30be40317f885b890c26525e04f8","observation_id":"61661f24-5128-4028-9f4a-cab87d879e8f","resolution":{"observed_at":"2026-05-12T20:58:58.990645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:b3fff2f7b6c94f741028fb192987cd0ec494b871f5f5d57d26bef4d22f3481e6","observation_id":"033a0815-e370-4512-8311-f765331f23a1","resolution":{"observed_at":"2026-05-15T20:21:57.935228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T12:06:13.697487Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2405.14573"},"observation_digest":"sha256:ef7643a469792f55807a12f3e6bfcad718b1e08ac6a0e97850e3cb9a5506c656","observation_id":"daff75fb-8129-47db-9e38-ec8905cb7402","resolution":{"observed_at":"2026-05-13T12:06:13.777835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:b305ce1a7e4a2a3b316f3d4a7fd3642e288159c0d41ec04334f23b0ba0d5648e","observation_id":"d20010ca-3451-405e-8a1e-55c27a43e0da","resolution":{"observed_at":"2026-05-19T11:55:30.172445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:ff56e4c4eabb495887dffd5b971646cc17749f2d1648692ea827f9af9691a194","observation_id":"18d3795f-aba7-4893-9d39-29fece85d28a","resolution":{"observed_at":"2026-05-17T10:46:28.769978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:0646e018569c7a5014c62a4dbba8d144b47a1975005a417250e68a1071079295","observation_id":"e4f5fead-4c87-4d63-bbed-2c9ec1fb625f","resolution":{"observed_at":"2026-05-19T11:08:27.968638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-08T14:24:50.335297Z","title":"Cogagent: A visual language model for gui agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06776","last_updated":"2025-05-22T17:59:11Z","snapshot_observed_at":"2026-08-08T15:07:58.758525Z","submitted_at":"2025-02-10T18:54:05Z","title":"InSTA: Towards Internet-Scale Training For Agents","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:24:50.335297Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.06776"},"observation_digest":"sha256:19437ef618701548058fc3b4e9262df23ddd5be1de49e8190252d4eb103dfa13","observation_id":"c4a373ce-8807-43ad-8fc8-84f984a0d932","resolution":{"observed_at":"2026-08-08T14:24:50.335297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-08T14:25:55.669886Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.669886Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:ec37ab7f38d0ab3d172c92e1b44478011bd1b94cecb238e32897a6e479ba6a3e","observation_id":"ecb5431c-b222-4c9f-85f8-60a5fe5f06a1","resolution":{"observed_at":"2026-08-08T14:25:55.669886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-08T06:01:31.626071Z","title":"org/CorpusID:229363676","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-09T23:01:21.326326Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.626071Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:93d19724a92ae6d362fa83525f8ae0ceb929ab23dfb6fa4aa6c99a33402312e1","observation_id":"485324ff-eeda-4a5d-8817-79a990391ed7","resolution":{"observed_at":"2026-08-08T06:01:31.626071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T20:57:48.425527Z","title":"Dmitry Kalashnikov, Alex Irpan, Peter Pastor, Julian Ibarz, Alexander Herzog, Eric Jang, Deirdre Quillen, Ethan Holly, Mrinal Kalakrishnan, Vincent Vanhoucke, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.15760","last_updated":"2025-02-13T18:55:14Z","snapshot_observed_at":"2026-08-07T22:34:53.289352Z","submitted_at":"2025-02-13T18:55:14Z","title":"Digi-Q: Learning Q-Value Functions for Training Device-Control Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:57:48.425527Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.15760"},"observation_digest":"sha256:423c7a689842951783b0b40eb2815eb8087293c4b4225e14970c62c62c2a7e52","observation_id":"ae727bc1-7c64-44bf-b741-9d442477c5da","resolution":{"observed_at":"2026-08-07T20:57:48.425527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T14:18:04.556039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19554","last_updated":"2025-05-26T06:17:21Z","snapshot_observed_at":"2026-08-09T08:50:26.066997Z","submitted_at":"2025-05-26T06:17:21Z","title":"Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:18:04.556039Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2505.19554"},"observation_digest":"sha256:966bec75fba4ba3eceb90411aa9f332c112220f39d92dd2cb1d9b6aba13dc436","observation_id":"53784e52-3283-4c3c-ae0f-0bb1fb454dde","resolution":{"observed_at":"2026-08-07T14:18:04.556039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T11:16:43.994161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03007","last_updated":"2025-06-03T15:45:41Z","snapshot_observed_at":"2026-08-10T00:48:35.502586Z","submitted_at":"2025-06-03T15:45:41Z","title":"DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:43.994161Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.03007"},"observation_digest":"sha256:16f89fe0aacee37251eb66379e56d834b7321d0804769f19c2d351d56c1910f6","observation_id":"ffb37659-bcbc-4cef-8a15-a406b0667597","resolution":{"observed_at":"2026-08-07T11:16:43.994161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T00:41:13.264774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12879","last_updated":"2025-06-15T15:09:37Z","snapshot_observed_at":"2026-08-09T18:06:46.391362Z","submitted_at":"2025-06-15T15:09:37Z","title":"Exploring the Potential of Metacognitive Support Agents for Human-AI Co-Creation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:13.264774Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.12879"},"observation_digest":"sha256:00bbc229518876acd81ff6a96bc148e815c5da478f4145e9f1ea284d9d827d7e","observation_id":"c4fb6c79-0874-4ebd-817a-ace03b950ed7","resolution":{"observed_at":"2026-08-07T00:41:13.264774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T21:44:51.212777Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-09T23:16:32.480451Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.212777Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:711feff6b1a6265530fdc896e07795cd42a4823f09fb83b4e2244e367eec317f","observation_id":"cc4f8ab6-75d4-4a7d-bf8b-aa198f685dbe","resolution":{"observed_at":"2026-08-06T21:44:51.212777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2507.04227","last_updated":"2026-04-14T14:47:25Z","snapshot_observed_at":"2026-08-01T14:12:08.736574Z","submitted_at":"2025-07-06T03:31:36Z","title":"Mobile GUI Agents under Real-world Threats: Are We There Yet?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T06:57:25.257775Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2507.04227"},"observation_digest":"sha256:cbc0c397b0b4c4a81e739fe4af17148b572186262eea55678c9424fcd63e9c2b","observation_id":"500ea2d7-0380-4833-8837-d97ded882cd3","resolution":{"observed_at":"2026-05-19T07:02:07.944025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T15:29:11.323765Z","title":"Cogagent: A visual language model for gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-08-07T08:12:57.119379Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:11.323765Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2507.15846"},"observation_digest":"sha256:4eb45cf646b3a005378d86b23b9413b6ab78c54c579063475fffed3264710ded","observation_id":"d0f6657d-6789-4ca2-a6f7-4dcdb6d7b6c8","resolution":{"observed_at":"2026-08-06T15:29:11.323765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T15:08:35.405743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16704","last_updated":"2025-07-22T15:38:12Z","snapshot_observed_at":"2026-08-09T17:12:55.581380Z","submitted_at":"2025-07-22T15:38:12Z","title":"Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:08:35.405743Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2507.16704"},"observation_digest":"sha256:2649c905667ff22cd556898fc68e58b26f84827a604b407cb8d550d013dc6a15","observation_id":"c8769967-487a-4cb0-973a-086bfb325e7f","resolution":{"observed_at":"2026-08-06T15:08:35.405743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T01:01:07.165776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04025","last_updated":"2025-08-06T02:38:02Z","snapshot_observed_at":"2026-08-09T01:41:25.985422Z","submitted_at":"2025-08-06T02:38:02Z","title":"Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T01:01:07.165776Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.04025"},"observation_digest":"sha256:d5060f0ccd7d8d6dea27355f8c79c47c5b7ceade80fa45cd93a8c55d94962166","observation_id":"b9019cd6-d586-44bf-9fd8-a4568a2e5b9c","resolution":{"observed_at":"2026-08-06T01:01:07.165776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T23:55:48.651764Z","title":"Cogagent: A visual language model for GUI agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04700","last_updated":"2025-08-12T15:11:53Z","snapshot_observed_at":"2026-08-09T20:49:03.329443Z","submitted_at":"2025-08-06T17:58:46Z","title":"SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:55:48.651764Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.04700"},"observation_digest":"sha256:64b0e532b1a1572b10376e90e5f79b7073f922c554b31c0890d4dc1b4d3884b1","observation_id":"174dd392-0872-481e-9294-fc014b238dca","resolution":{"observed_at":"2026-08-05T23:55:48.651764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T17:45:20.465838Z","title":"CogAgent: A Visual Language Model for GUI Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16688","last_updated":"2025-08-21T18:39:35Z","snapshot_observed_at":"2026-08-09T15:10:02.394602Z","submitted_at":"2025-08-21T18:39:35Z","title":"Cybernaut: Towards Reliable Web Automation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:20.465838Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.16688"},"observation_digest":"sha256:29c711858db491a7e9ec98faa175e4a889c7488d929b606b1e9fb7e50ee31d93","observation_id":"0aeabdef-01b3-41ce-91ab-3bbc1577c9e6","resolution":{"observed_at":"2026-08-05T17:45:20.465838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T15:19:50.628996Z","title":"Cogagent: A visual language model for GUI agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-08-09T15:33:57.613925Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:50.628996Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.20096"},"observation_digest":"sha256:8d7b2a9a419fc895ae89e02fe302041a3947b517bb37b178bd38ec82ad783dca","observation_id":"0f880a2d-6315-4c62-ae82-8b20b54c5721","resolution":{"observed_at":"2026-08-05T15:19:50.628996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T13:34:59.368315Z","title":"arXiv:2312.08914 [cs.CV] https://arxiv.org/abs/2312.08914","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00531","last_updated":"2025-08-30T15:24:47Z","snapshot_observed_at":"2026-08-07T16:52:46.214045Z","submitted_at":"2025-08-30T15:24:47Z","title":"MobiAgent: A Systematic Framework for Customizable Mobile Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:34:59.368315Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2509.00531"},"observation_digest":"sha256:94d4028664d689f0979e2b955f85677f20fff71b985305debd6c4eaf2159ce83","observation_id":"56f30723-c351-4607-9e16-bbe77c31f994","resolution":{"observed_at":"2026-08-05T13:34:59.368315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-04T09:03:38.142743Z","title":"Cogagent: A visual language model for gui agents.arXiv preprint arXiv:2312.08914,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17790","last_updated":"2026-05-26T11:29:37Z","snapshot_observed_at":"2026-08-04T09:03:36.135394Z","submitted_at":"2025-10-20T17:48:26Z","title":"UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:03:38.142743Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2510.17790"},"observation_digest":"sha256:654cee96cd4454aacf9bb238b7fb59ce4997222d8b53ae6722d814005dc7a948","observation_id":"54e9756b-4558-43e2-8a15-858c219cc315","resolution":{"observed_at":"2026-08-04T09:03:38.142743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-03T23:06:04.882108Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-09T15:43:09.649238Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.882108Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:7894ceefadef5e4bd91f60380054105477bbe8cabc8bfd4318c6362d83a4df87","observation_id":"3be052ac-8eed-4fad-9a52-bf977b2ebc20","resolution":{"observed_at":"2026-08-03T23:06:04.882108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-02T20:51:41.781289Z","title":"Cogagent: A visual language model for gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.22190","last_updated":"2026-05-25T21:32:44Z","snapshot_observed_at":"2026-08-02T20:51:33.578240Z","submitted_at":"2026-02-25T18:34:57Z","title":"GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T20:51:41.781289Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2602.22190"},"observation_digest":"sha256:451ac2a26f7985e12e40efcada1c89448ab0c41fc39abd8ed97e2059f98d32e2","observation_id":"0ed4a0e8-0cda-4841-95b3-4d180ee4915f","resolution":{"observed_at":"2026-08-02T20:51:41.781289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2312.08914 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-07T09:23:25.859554Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:170d25a699387eae61acebf2928923b283cb45e7ad714e95d63413418e701e62","observation_id":"db48a1f3-5977-4056-9f33-511c1ac79750","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2604.08516","last_updated":"2026-04-09T17:54:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:54:02Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:34.401698Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2604.08516"},"observation_digest":"sha256:b68f34e69310e93b0ff5bf0838e78f6eea634f1498a2f670e7645f8286a5f04a","observation_id":"dd3a4c5c-dccb-4200-8e20-0c5f3b88b3e8","resolution":{"observed_at":"2026-05-11T05:40:58.721350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2604.14113","last_updated":"2026-04-15T17:32:28Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:32:28Z","title":"UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:06:55.472857Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2604.14113"},"observation_digest":"sha256:9d5dcc79e768b2c27fc5a46f3f0c122d5d58b0fcef3315e42168ef2cf3746ee6","observation_id":"b3b6f78c-33cd-47bf-890b-39f1bd64ead3","resolution":{"observed_at":"2026-05-10T14:10:28.874668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2604.26622","last_updated":"2026-04-29T12:49:30Z","snapshot_observed_at":"2026-08-09T09:48:28.683521Z","submitted_at":"2026-04-29T12:49:30Z","title":"OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-07T10:45:48.976501Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2604.26622"},"observation_digest":"sha256:0975388aeeaa56fc0533c6955f8235881c6f912244d2882ebd7aeab3eb7c82c8","observation_id":"8a73181f-a9c7-45ae-99e5-6d60903a08d1","resolution":{"observed_at":"2026-05-12T09:31:25.492638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:05:36.511150Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:169ed89e31b64c048e679c912754cee50d84ac6f878621cb1b8c0f5a4d1b7567","observation_id":"85007b8e-8431-49fe-82af-c599ef7c4e98","resolution":{"observed_at":"2026-05-14T19:07:51.413266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T05:59:44.669877Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:ae814e9ba2179bc4c65a4bc260df23b507e6934ebf9a00c0e9e503e83d765821","observation_id":"27da449a-793a-4628-95e2-045219275cd9","resolution":{"observed_at":"2026-05-15T05:59:48.175276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:a39e65f0ce67be40af7fbbc8dabe7ed7ae4e920c4b8f09762d890d58751f5d86","observation_id":"94636b68-cf0c-4e6c-ae31-eed6da1a0af7","resolution":{"observed_at":"2026-06-30T21:35:04.557252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.25160","last_updated":"2026-06-18T02:24:07Z","snapshot_observed_at":"2026-08-03T08:02:05.766526Z","submitted_at":"2026-05-24T16:33:14Z","title":"ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T10:57:59.013811Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.25160"},"observation_digest":"sha256:aa2f8052f52779eee39a3aedb90861fc98298f5379126ab9db96f0f33b8a259a","observation_id":"7c800237-0192-4771-8bc4-b9d0d66db98d","resolution":{"observed_at":"2026-06-30T11:04:37.662147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:009fc8a6913fad7b0ccc30b23c2a1cebbf7e5d1b53f99993c99e52b8208ae1fb","observation_id":"d44059e2-596b-4f0b-b5e0-6fb567de06a8","resolution":{"observed_at":"2026-06-29T23:04:02.060945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.29400","last_updated":"2026-05-28T05:49:36Z","snapshot_observed_at":"2026-08-06T18:01:03.220098Z","submitted_at":"2026-05-28T05:49:36Z","title":"Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:38:35.829605Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.29400"},"observation_digest":"sha256:d92c5ca15419ab7ba8474ceb48b17ccfa352b416e9b1ffb968d7a23a6761beb7","observation_id":"546643e6-e15f-424f-94c6-5f61d0749a71","resolution":{"observed_at":"2026-06-29T07:43:13.153036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.30884","last_updated":"2026-05-29T06:17:53Z","snapshot_observed_at":"2026-07-06T23:40:07.833692Z","submitted_at":"2026-05-29T06:17:53Z","title":"GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T22:52:04.755523Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.30884"},"observation_digest":"sha256:92397588c31e9f6a358351b68d1cc12e748143b9c1f6636591388f83f9c9a3df","observation_id":"65db81a9-6606-4ac4-a108-bae0d9e901bf","resolution":{"observed_at":"2026-06-28T22:52:44.696258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:a8c038cc3f631c56c4faa27042a03e52917ca2b79188c58f0deee1542cefae0d","observation_id":"749f98ca-d7b8-49b0-9933-53d2beb899bc","resolution":{"observed_at":"2026-07-03T17:18:44.013381Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.17321","last_updated":"2026-06-15T22:04:11Z","snapshot_observed_at":"2026-07-06T23:52:57.359941Z","submitted_at":"2026-06-15T22:04:11Z","title":"ProCUA-SFT Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T03:18:04.149281Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.17321"},"observation_digest":"sha256:2868c1f5fb88d694dff650eb232ecc3ec2cd1060f4ea4aa0192a7e436ab00956","observation_id":"84ef5e59-b519-46dd-bf4d-9381a206014c","resolution":{"observed_at":"2026-07-03T18:08:46.718222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.20717","last_updated":"2026-06-16T15:31:33Z","snapshot_observed_at":"2026-08-03T03:41:11.931921Z","submitted_at":"2026-06-16T15:31:33Z","title":"MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T00:54:00.944706Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.20717"},"observation_digest":"sha256:16a21d5aad04a7f32d2e12a2be10bd292093c50a73016cb6a30cba0da812b8f6","observation_id":"bd8d87a1-6bcc-4cfd-84ef-01068cbd907e","resolution":{"observed_at":"2026-07-03T21:08:58.345016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-02T18:05:44.581086Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:43ea5540794f2a86d35769f12221330739ba9a32adb257fd9bd0ef80cb857dd4","observation_id":"fe492bcf-aa7d-4260-9aad-21ab9317c5e1","resolution":{"observed_at":"2026-06-30T07:54:22.413201Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T07:10:38.909339Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:c305251879e278f28296bfefeb7696c186bc9a037e18af33dfa98718cea5b51c","observation_id":"959a6d74-e4cc-420b-8379-73eb220a464b","resolution":{"observed_at":"2026-06-30T07:14:21.193108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-15T10:24:53.345620Z","title":"CogAgent: A visual language model for GUI agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T10:24:53.345620Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:b9b3963cc8a9994a2e432a617114400d431a815b6b862a809687eb7785a5437c","observation_id":"a12d611d-2687-48b6-b2bc-a2aa74e42147","resolution":{"observed_at":"2026-07-15T10:24:53.345620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2312.08914 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:e999592bb167c1382b61a14f0904abc686bf984bbf475cbc1a2b01bd69922df0","observation_id":"ab5b6383-dd99-419b-b36e-d40de6cb68c1","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-31T10:42:21.217308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28341","last_updated":"2026-07-30T15:07:00Z","snapshot_observed_at":"2026-08-09T18:08:40.777860Z","submitted_at":"2026-07-30T15:07:00Z","title":"Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T10:42:21.217308Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2607.28341"},"observation_digest":"sha256:3b2f228257126486bfb02722691da76e6e4fabc4dfbc04c8f4f5e5c32032463d","observation_id":"3e873257-3ded-4458-b51d-c2dc656c60c2","resolution":{"observed_at":"2026-07-31T10:42:21.217308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T21:40:39.900263Z","title":"arXiv:2312.08914","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05891","last_updated":"2026-08-06T11:15:41Z","snapshot_observed_at":"2026-08-10T01:15:02.149227Z","submitted_at":"2026-08-06T11:15:41Z","title":"AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T21:40:39.900263Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2608.05891"},"observation_digest":"sha256:03db91a86c61861508bb97971838be662a736616f52e558da67f60fbacda2998","observation_id":"19c92063-4d6b-49e1-96ae-3daa64838819","resolution":{"observed_at":"2026-08-07T21:40:39.900263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.08914/citation-record","integrity":"/paper/2312.08914/integrity","json":"/paper/2312.08914/citation-record.json","paper":"/paper/2312.08914"},"outbound":[],"paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2312.08914."}