{"as_of":"2026-08-14T15:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19aaacf1f9e3d9d940d72bdee92d2b69869d6826b5b1f8d41a176aac291f198b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:40:24.948959Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T21:28:58.598336Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"cited_work":{"arxiv_id":"2605.13527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13527","snapshot_observed_at":"2026-07-03T21:28:58.598336Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","venue":"cs.AI","work_id":"51fb1e95-531c-4374-abe2-0529fa06ca0c","year":2026},"citing_paper":{"arxiv_id":"2606.18448","last_updated":"2026-06-16T19:57:07Z","snapshot_observed_at":"2026-08-13T15:52:14.960876Z","submitted_at":"2026-06-16T19:57:07Z","title":"VISUALSKILL: Multimodal Skills for Computer-Use Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T00:35:02.162386Z"},"links":{"cited_paper":"/paper/2605.13527","citing_paper":"/paper/2606.18448"},"observation_digest":"sha256:7661a163cd15bd83ea571e2632d59dd5c69eaa4045a7718283d48ea1084b4da9","observation_id":"702efe0b-ac8e-46d6-8d36-888bc44bc171","resolution":{"observed_at":"2026-07-03T21:28:58.599988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13527","snapshot_observed_at":"2026-08-04T23:05:27.821099Z","title":"arXiv preprint arXiv:2605.13527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01678","last_updated":"2026-08-03T04:14:59Z","snapshot_observed_at":"2026-08-11T17:36:50.405307Z","submitted_at":"2026-08-03T04:14:59Z","title":"Progressive Agent Skill Generation via Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T23:05:27.821099Z"},"links":{"cited_paper":"/paper/2605.13527","citing_paper":"/paper/2608.01678"},"observation_digest":"sha256:aee189af3838421f6f96e6e211ba0c3ff5a34d59f47c986cda4c5f10c2890376","observation_id":"d40bb2e2-fc90-4791-a14a-fdce8722497c","resolution":{"observed_at":"2026-08-04T23:05:27.821099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13527","snapshot_observed_at":"2026-08-12T17:40:24.948959Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10775","last_updated":"2026-08-11T10:28:59Z","snapshot_observed_at":"2026-08-14T15:12:49.306933Z","submitted_at":"2026-08-11T10:28:59Z","title":"SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:24.948959Z"},"links":{"cited_paper":"/paper/2605.13527","citing_paper":"/paper/2608.10775"},"observation_digest":"sha256:078ace244e8ab581caf8ad07b46a65225451a6aff7dc91938bc12e900ecbd2f1","observation_id":"fbc7bbd1-c0e6-4a53-a802-1110597c64e5","resolution":{"observed_at":"2026-08-12T17:40:24.948959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.13527/citation-record","integrity":"/paper/2605.13527/integrity","json":"/paper/2605.13527/citation-record.json","paper":"/paper/2605.13527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.08164","last_updated":"2024-10-10T17:43:51Z","snapshot_observed_at":"2026-08-13T16:08:04.879605Z","submitted_at":"2024-10-10T17:43:51Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","version":1},"cited_work":{"arxiv_id":"2410.08164","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08164","snapshot_observed_at":"2026-07-03T16:08:37.200822Z","title":"Agent s: An open agentic framework that uses computers like a human","venue":null,"work_id":"743d8ba1-e742-4bc5-9035-81021a53b57a","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2410.08164","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:28978f75141b3e036a5c800370d085f3d3b1c1446748e661dda27feed5145b15","observation_id":"27f60dd1-2323-4e7e-8558-d4e2245774ab","resolution":{"observed_at":"2026-06-30T21:35:04.539803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:ae5befa80e2a38dbb873d6b477dc699a397b0e76185923a59d4d86d5ada0446d","observation_id":"3404e158-0908-4681-bd78-52d75c500e8d","resolution":{"observed_at":"2026-06-30T21:35:04.553070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02766","last_updated":"2026-03-03T09:07:22Z","snapshot_observed_at":"2026-08-04T19:32:12.955430Z","submitted_at":"2026-03-03T09:07:22Z","title":"EvoSkill: Automated Skill Discovery for Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":"2603.02766","doi":"10.48550/arxiv.2603.02766","metadata_source":"pith","pith_arxiv_id":"2603.02766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EvoSkill: Automated Skill Discovery for Multi-Agent Systems","venue":"cs.AI","work_id":"94c2c7b2-0c94-4b32-90cc-bc154d192850","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2603.02766","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:aad0e8606ce4458f6a491fbe619802723296d4951e2c04ba8704ac39347023cd","observation_id":"7c5ea0d4-d852-4801-beab-83f5d2c2ce0d","resolution":{"observed_at":"2026-06-30T21:35:04.564993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:05a2b9f369b26d510a34bdebb996944e70343935ba593cda404af9f336767856","observation_id":"bcc50edf-73f8-4ac3-9788-e5fd9fc07dc4","resolution":{"observed_at":"2026-06-30T21:35:04.531773Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:47f32074be746efb3bb0cd2734700867c1ca5356067b3f4c790c7cdececa655c","observation_id":"c9ba6989-a8b5-4648-9d8e-c9d592447fdb","resolution":{"observed_at":"2026-06-30T21:35:04.567653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:28:58.604302Z","title":"Cua-skill: Develop skills for computer using agent","venue":null,"work_id":"28eae16a-d396-41a7-9ddd-954637759251","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:4a36082f4bd84c8ad0be50bd2f2e5dee1a9d50fa5a59063861ac9718d71222c6","observation_id":"3392dde1-a5a7-4dff-9ad1-10d98d94482b","resolution":{"observed_at":"2026-06-30T21:35:04.570747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.505","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SeeClick: Harnessing GUI grounding for advanced visual GUI agents","venue":null,"work_id":"b6995d62-fe9c-46ef-9a41-38b0179ed138","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:9b986ea9bed34de637be1225b9d8829d2fb2d1d72ce2111d7f17c29a894bacc3","observation_id":"1ac47709-125b-4b0b-a94a-6c1fe1b96c22","resolution":{"observed_at":"2026-06-30T21:35:04.028125Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:30.157565+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:30.157565+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-08-14T08:19:18.935225Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":"2306.06070","doi":"10.48550/arxiv.2306.06070","metadata_source":"pith","pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mind2Web: Towards a Generalist Agent for the Web","venue":"cs.CL","work_id":"e26f5a00-c007-439d-83f6-7900f5687b6b","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:0a801b9498e1fcf95c4060359f88aade84a97f0e193d5455224c92f3c0f47282","observation_id":"f9c180a3-5e0f-49ba-899a-d1423645518c","resolution":{"observed_at":"2026-06-30T21:35:04.573142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:29.437492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:29.437492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-08-14T03:01:52.063606Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":"2410.05243","doi":"10.48550/arxiv.2410.05243","metadata_source":"pith","pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","venue":"cs.AI","work_id":"9def1724-6fd2-4d5b-8339-4c1ee76e62f8","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:71cfcc5924205cd3e418c9399ca8cdb4cb60a209ada5e44384d76b7538ff5bd1","observation_id":"a5d0bb76-3bb8-4243-98c6-88069d3677a3","resolution":{"observed_at":"2026-06-30T21:35:04.554540Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.371","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":"5549b83c-a0a2-4e60-ac23-4e941c945664","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:8c6f8c15a4a6cb65d14858ba5de1a8e1476e4eea52ae3ced1885847e5268a958","observation_id":"2d08272c-fa46-4bac-983d-5a6ae8850db4","resolution":{"observed_at":"2026-06-30T21:35:04.018795Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T02:24:35.193099+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T02:24:35.193099+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-13T05:02:31.052003Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:559e555b2bf3d218bd6ecfd4570bce9431982bd94ca5b171d3f5525b7aca642c","observation_id":"94636b68-cf0c-4e6c-ae31-eed6da1a0af7","resolution":{"observed_at":"2026-06-30T21:35:04.557252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-08-10T08:39:37.621137Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"cited_work":{"arxiv_id":"2505.15146","doi":"10.48550/arxiv.2505.15146","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing, Ion Stoica, Tajana Rosing, Haojian Jin, and Hao Zhang","venue":"ArXiv.org","work_id":"10ddd4f7-8f21-466f-b975-f64ea89b9b2e","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2505.15146","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:13677b085a5e8c586494e51ac5880ae190433f8b84eb8b4a63cbb0d91875f2d0","observation_id":"1d368f40-3266-41ea-8cdd-8b9fb6fa95df","resolution":{"observed_at":"2026-06-30T21:35:04.559898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco_a_00393","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https: //doi.org/10.1162/NECO_a_00393","venue":"Neural Computation","work_id":"1c90dc69-0035-48bb-9aa6-a78e5afc98e6","year":2013},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:d462be001846b6776f2417af6d4cb91e04fc5183ecf2be0255a271bd93908107","observation_id":"0287352e-4c26-41e5-ad64-53153b595a65","resolution":{"observed_at":"2026-06-30T21:35:04.020654Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12056","last_updated":"2026-07-01T10:34:53Z","snapshot_observed_at":"2026-08-09T06:53:07.122627Z","submitted_at":"2026-03-12T15:25:57Z","title":"XSkill: Continual Learning from Experience and Skills in Multimodal Agents","version":3},"cited_work":{"arxiv_id":"2603.12056","doi":"10.48550/arxiv.2603.12056","metadata_source":"pith","pith_arxiv_id":"2603.12056","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xskill: Continual learning from experience and skills in multimodal agents","venue":"cs.AI","work_id":"6bec6eef-86ec-49a5-a730-a01e19656d75","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2603.12056","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:48e6ad7100bdcd34351e66c1a7f217ac9b0987e77eaff80b5791ec06ff38ca9f","observation_id":"979ab9c9-eef2-4982-920c-ee23418528e0","resolution":{"observed_at":"2026-07-02T02:17:26.572211Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.50","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VisualWebArena: Evaluating multimodal agents on realistic visual web tasks","venue":null,"work_id":"7a18db33-5a35-436c-ba83-41b4602aea68","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:64f7d9985487caef739a834048e0280806db34c24c56ec8ec0de86543314df35","observation_id":"4087e90b-091f-4724-93f4-c624695fe047","resolution":{"observed_at":"2026-06-30T21:35:04.034096Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-15T19:20:32.353486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T19:20:32.353486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8891.2023","doi":"10.1109/icra48891.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ImmFusion: Robust mmWave-RGB Fusion for 3D Human Body Reconstruction in All Weather Conditions","venue":null,"work_id":"fafcadb0-b1fa-4b90-99aa-b36501c38439","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:d08781b02a84420995f61aee51dc1c1080f8e49b9e990b759b85c3b805eef68d","observation_id":"01b9da5e-81cb-4be0-abad-2355726a4b21","resolution":{"observed_at":"2026-06-30T21:35:04.025940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:16.40985+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:16.40985+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":"2307.03172","doi":"10.1162/tacl","metadata_source":"pith","pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the Middle: How Language Models Use Long Contexts","venue":"cs.CL","work_id":"37c05e13-4a24-44f8-a1c4-da1bbe7223aa","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:283770deeece63e032e2bbe5dce760d09c90c77a189ef65bdabd6fefe90e78b4","observation_id":"542aed55-042d-4ba5-a172-7ad1f4a18820","resolution":{"observed_at":"2026-06-30T21:35:04.023262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04323","last_updated":"2026-04-06T00:10:30Z","snapshot_observed_at":"2026-08-12T21:06:00.158828Z","submitted_at":"2026-04-06T00:10:30Z","title":"How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings","version":1},"cited_work":{"arxiv_id":"2604.04323","doi":"10.48550/arxiv.2604.04323","metadata_source":"pith","pith_arxiv_id":"2604.04323","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings","venue":"cs.CL","work_id":"1298ec8c-0f55-41e8-b684-19c3f512378d","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2604.04323","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:b14f5ca3755e0623505cc9a2b5a5c853f91ac42c805c8ff920d9ac72823b6dd2","observation_id":"5754cc06-b451-4cb4-a214-f528d2cfef92","resolution":{"observed_at":"2026-06-30T21:35:04.543425Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00203","last_updated":"2024-08-01T00:00:43Z","snapshot_observed_at":"2026-08-12T23:10:37.552123Z","submitted_at":"2024-08-01T00:00:43Z","title":"OmniParser for Pure Vision Based GUI Agent","version":1},"cited_work":{"arxiv_id":"2408.00203","doi":"10.48550/arxiv.2408.00203","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.00203","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omniparser for pure vision based gui agent","venue":"arXiv (Cornell University)","work_id":"a17adac7-d7c5-4410-9509-13b1d0cab0ce","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2408.00203","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:4fceba8c562259eef9dcad1529755c8463c7cbd55b4d48c604ce0b0c69f7ddf2","observation_id":"1edb1189-7738-40a4-9a4b-387635fc2c22","resolution":{"observed_at":"2026-06-30T21:35:04.549327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08377","last_updated":"2026-08-10T11:40:00Z","snapshot_observed_at":"2026-08-13T23:38:44.225146Z","submitted_at":"2026-04-09T15:38:27Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","version":2},"cited_work":{"arxiv_id":"2604.08377","doi":"10.48550/arxiv.2604.08377","metadata_source":"pith","pith_arxiv_id":"2604.08377","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","venue":"cs.AI","work_id":"31a44ebb-9aae-4719-8d62-50f8c82ece16","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2604.08377","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:61c9940b42edc07b1a7113837ee293fdb38edb3e01f685a383daf33ef24dacb6","observation_id":"20ce9619-cb9a-4aa5-a70d-2ab5746ca70d","resolution":{"observed_at":"2026-06-30T21:35:04.580530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/cbo9780511811678","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:35:04.028681Z","title":"URL https://doi.org/ 10.1017/CBO9780511811678","venue":null,"work_id":"422b6fe2-d550-4cba-b6dc-a0d96df44d9a","year":null},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:3755d1211f84351a312f0db1c8e515bfce30bfbe61e9cb7d6cefbc5225b111d6","observation_id":"542e943b-0bd4-46d0-a554-da29ca0c95b1","resolution":{"observed_at":"2026-06-30T21:35:04.030066Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-12T05:13:16.784054Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":"2310.08560","doi":"10.48550/arxiv.2310.08560","metadata_source":"pith","pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemGPT: Towards LLMs as Operating Systems","venue":"cs.AI","work_id":"2698f5ad-c84c-40ca-b839-0912dae10ba2","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:67c7470f035841fdc60ebbe92af4d07a8a35ab1541b9635a0901c2e754bd774e","observation_id":"17e48366-d340-4fb1-a2c8-84c073bb9bbd","resolution":{"observed_at":"2026-06-30T21:35:04.583018Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-08-14T04:44:13.552688Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":"2304.03442","doi":"10.1001/jamapsychiatry.2022.0609","metadata_source":"pith","pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","venue":"cs.HC","work_id":"01f7ddaa-284a-441a-be87-921aad4dc54b","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:1a06e419595f2a2f756e0c93490c8d5c127c14a06baace4218b1daf609fa395e","observation_id":"788c8ecb-23b7-4bee-bc96-179de575995e","resolution":{"observed_at":"2026-06-30T21:35:04.562519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:54:33.103795+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:54:33.103795+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:ba937d1cf2235c66bfd762cfbbd472dafaa828bfeed9598c713e51a2e0c4976d","observation_id":"8fb550e3-a08d-4eb1-aa7c-44136aaa74aa","resolution":{"observed_at":"2026-06-30T21:35:04.540664Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10088","last_updated":"2023-10-27T14:24:31Z","snapshot_observed_at":"2026-08-13T10:52:30.442825Z","submitted_at":"2023-07-19T15:57:24Z","title":"Android in the Wild: A Large-Scale Dataset for Android Device Control","version":2},"cited_work":{"arxiv_id":"2307.10088","doi":"10.48550/arxiv.2307.10088","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Android in the wild: A large-scale dataset for android device control","venue":"arXiv (Cornell University)","work_id":"a85f090f-dacb-478b-9ccf-0c2b52eb4a75","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2307.10088","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:a6da26ed04c1bb089829875d4929c35601ac71a77619e58c8c31f525b3df786b","observation_id":"9405978a-5fbe-4e3a-90a0-cfe5cee7c255","resolution":{"observed_at":"2026-06-30T21:35:04.546582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-13T23:11:04.935073Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":"2405.14573","doi":"10.48550/arxiv.2405.14573","metadata_source":"pith","pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","venue":"cs.AI","work_id":"c5116d19-d3d3-40fd-9620-f7489812a9ba","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:a218590dfb45c5db507eacea912f83038730b5920cd2369c61d14f48c29aba85","observation_id":"b8502d64-b27a-4b45-b0e2-b68c71a1a255","resolution":{"observed_at":"2026-06-30T21:35:04.578198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.383096Z","title":"nips.cc/paper_files/paper/2023/hash/1b44b878bb782e6954cd888628510e90-Abstract-Conference.html","venue":null,"work_id":"5f3a0f3f-a092-495a-a88a-c7bdceb2571e","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:7a0a74cb5711e4064a7ebde57ecbae55cc3a3ba48cdbe73438ae7aceaedf54a5","observation_id":"a372cebe-cfda-4c19-a95a-4794b8b719e8","resolution":{"observed_at":"2026-07-07T16:53:57.384410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:db28c5840bfa9913e00d2766361f83eb2b0fad3373369c71b446d015b0c6e59f","observation_id":"47b3dbea-0a21-4aac-a219-8fdd899775fb","resolution":{"observed_at":"2026-06-30T21:35:04.032447Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":"2302.01560","doi":"10.48550/arxiv.2302.01560","metadata_source":"pith","pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","venue":"cs.AI","work_id":"94908c37-3d13-4530-adc9-1d6814616759","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:05f62c4739e18a8023ab6e8db88e61e6b728ef0caa11111f1a9d91ea1a45a723","observation_id":"d6c43618-8764-4b86-98a2-895dde225359","resolution":{"observed_at":"2026-06-30T21:35:04.531961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08234","last_updated":"2026-02-09T03:17:17Z","snapshot_observed_at":"2026-08-14T13:08:11.068836Z","submitted_at":"2026-02-09T03:17:17Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2602.08234","doi":"10.48550/arxiv.2602.08234","metadata_source":"pith","pith_arxiv_id":"2602.08234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","venue":"cs.LG","work_id":"536a9d0a-baed-4eb9-9a51-f2b585c3388b","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2602.08234","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:7dacbe858a837f951647c6c1aa5d17c2c4d1ded7d1f005161dc1118d223b3758","observation_id":"b45f1b66-cccf-415e-8da9-d36a804694f2","resolution":{"observed_at":"2026-06-30T21:35:04.575834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10387","last_updated":"2025-06-12T06:21:19Z","snapshot_observed_at":"2026-08-09T11:09:09.637889Z","submitted_at":"2025-06-12T06:21:19Z","title":"Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills","version":1},"cited_work":{"arxiv_id":"2506.10387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10387","snapshot_observed_at":"2026-06-30T21:35:04.527792Z","title":"Mirage-1: Augmenting and updating gui agent with hierarchical multimodal skills.arXiv preprint arXiv:2506.10387","venue":null,"work_id":"ba5bc0df-5aa8-497c-9121-7b4ac95aa9bb","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2506.10387","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:eeac5e6666242fd89e74d30ffc9ef50a597cf22efa3e8ce71f7168b5e09ac19b","observation_id":"c2f5d302-2ccc-409b-8ec0-593dd6d874ea","resolution":{"observed_at":"2026-06-30T21:35:04.529397Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-06T11:11:16.632352Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":"2602.12430","doi":"10.48550/arxiv.2602.12430","metadata_source":"pith","pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","venue":"cs.MA","work_id":"a64d3985-6826-492c-8a2e-f0965d805bfd","year":2026},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:c422a013464bb126776854f44eb925b4559069ab73655558ac6d45e093a279dd","observation_id":"65319806-9555-4e7f-86a3-80378cb86217","resolution":{"observed_at":"2026-06-30T21:35:04.534667Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11170","last_updated":"2025-03-14T08:16:02Z","snapshot_observed_at":"2026-08-07T17:04:44.105115Z","submitted_at":"2025-03-14T08:16:02Z","title":"DeskVision: Large Scale Desktop Region Captioning for Advanced GUI Agents","version":1},"cited_work":{"arxiv_id":"2503.11170","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11170","snapshot_observed_at":"2026-06-30T21:35:04.517827Z","title":"Jingyi Yang, Shuai Shao, Dongrui Liu, and Jing Shao","venue":null,"work_id":"eb871075-9634-4112-809d-fa5daa3b5fe6","year":null},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2503.11170","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:372dd460d08eb52e636dc24074fb58c8c2c114ed941d46a5ec391238d80879d0","observation_id":"6eb4e3bf-a14c-45f1-82a2-4d718435a0b5","resolution":{"observed_at":"2026-06-30T21:35:04.519678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-13T04:56:53.111742Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":"2312.13771","doi":"10.48550/arxiv.2312.13771","metadata_source":"pith","pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AppAgent: Multimodal Agents as Smartphone Users","venue":"cs.CV","work_id":"c3239910-590f-4891-bf7e-c462ffee2e9d","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:e51c479e53232656ccd958e7412fec32fe04bc4200904becd54e60b545e7f3bd","observation_id":"4832a7eb-97d6-44da-bc89-bc085fb57c55","resolution":{"observed_at":"2026-06-30T21:35:04.526584Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11119","last_updated":"2024-09-08T04:25:32Z","snapshot_observed_at":"2026-08-13T00:28:32.621326Z","submitted_at":"2024-04-17T07:07:41Z","title":"DREAM: A Dual Representation Learning Model for Multimodal Recommendation","version":2},"cited_work":{"arxiv_id":"2404.11119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11119","snapshot_observed_at":"2026-06-30T21:35:04.520851Z","title":"Kangning Zhang, Wenxiang Jiao, Kounianhua Du, Yuan Lu, Weiwen Liu, Weinan Zhang, and Yong Yu","venue":null,"work_id":"c189fa25-c708-415b-a64d-40ec26bb5caf","year":null},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2404.11119","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:55e3b156babd519505b4c9eb380a9d495be39426ef52f28883c9ad104d3bc5a1","observation_id":"1c3874fc-d936-40cb-b361-4736247cd03b","resolution":{"observed_at":"2026-06-30T21:35:04.522570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:55:46.338705Z","title":"Boyuan Zheng, Boyu Gou, Jihyung Kil, Huan Sun, and Yu Su","venue":null,"work_id":"b218ccea-9b01-4a0a-b47a-669e7bcaee03","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:d47f38ee43202ed44d7007b61a7835e28ce882b13fa9d58423a8d4c5c2b2ee7d","observation_id":"00a25186-d3ee-4694-b252-d75c54fde55e","resolution":{"observed_at":"2026-06-30T21:35:04.537817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-08-13T20:16:41.272728Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":"2401.01614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-08T16:15:06.143411Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","venue":"cs.IR","work_id":"d3503fef-7f64-4dcc-8aca-1f16e997034f","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:839bee0594e79fc0b471242552475d46f3f3eed6dcdaf6dae6f7639f08dd65dd","observation_id":"83b02c05-c62d-40b7-aca2-02fac7f769a8","resolution":{"observed_at":"2026-06-30T21:35:04.507748Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07079","last_updated":"2025-04-09T17:51:50Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:51:50Z","title":"SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills","version":1},"cited_work":{"arxiv_id":"2504.07079","doi":"10.48550/arxiv.2504.07079","metadata_source":"pith","pith_arxiv_id":"2504.07079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills","venue":"cs.AI","work_id":"72b1aff0-91c3-4500-abc9-22129ca67748","year":2025},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2504.07079","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:9d8551652b51ece8b0c951ce70ea20040b83e1601c1a24d097e2d38ed93c54af","observation_id":"050be9a3-a594-4c99-b9c3-26a3f3550514","resolution":{"observed_at":"2026-06-30T21:35:04.537066Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:94d970ac752521d393b65fc6c4aed6b50b9c544e561d4b176bb94c257c88f75c","observation_id":"d60c3f31-2c53-4485-8036-1ed7c73cb0cb","resolution":{"observed_at":"2026-06-30T21:35:04.501725Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.381198Z","title":"Recent LLM agents have made skills a practical interface for storing and composing procedural knowledge in language-conditioned environments","venue":null,"work_id":"ab961969-bd92-4eb5-9bfa-662633984bb5","year":1999},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:17aa1e421f20eac4652c600785e981cb29afb61ddc412f8546cad69e625bba5d","observation_id":"c528b9a5-e8c8-4dcc-8d27-20012df7a473","resolution":{"observed_at":"2026-07-07T16:53:57.382533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":24,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":2},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2605.13527."}