{"as_of":"2026-08-10T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fd372da895e2b90e7bbcb50ce4e80668532681b05a2bde5f3ab936112f1c579","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:11:48.561600Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03095/citation-record","integrity":"/paper/2506.03095/integrity","json":"/paper/2506.03095/citation-record.json","paper":"/paper/2506.03095"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.00906","last_updated":"2025-04-01T15:40:27Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:40:27Z","title":"Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00906","snapshot_observed_at":"2026-08-07T11:11:46.803506Z","title":"Agent s2: A compositional generalist-specialist framework for computer use agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:46.803506Z"},"links":{"cited_paper":"/paper/2504.00906","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:2acc94702dc64b1cdfa5fa274f2d7b84e49921927af1936b8fd4f1acdb3635d4","observation_id":"84a62ef0-d64b-4099-8946-7d03bf5faaa2","resolution":{"observed_at":"2026-08-07T11:11:46.803506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:11:46.892805Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:46.892805Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:65d75d925dcdf94b45646d59bb97dd11ec9acf69dbdee9fe0250b70f890cf71b","observation_id":"ea1053d5-30ed-4248-9cb2-640ec29e577f","resolution":{"observed_at":"2026-08-07T11:11:46.892805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08264","last_updated":"2024-09-13T20:17:13Z","snapshot_observed_at":"2026-08-05T14:11:56.506073Z","submitted_at":"2024-09-12T17:56:43Z","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08264","snapshot_observed_at":"2026-08-07T11:11:46.979114Z","title":"Windows agent arena: Evaluating multi-modal os agents at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:46.979114Z"},"links":{"cited_paper":"/paper/2409.08264","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:2346c82823dad437d4fcd511c286b849c21d8598a9a3a7ccc1c6bbe22f6787ae","observation_id":"05cea6c6-4d04-40f8-9aa7-ee208e20f0b7","resolution":{"observed_at":"2026-08-07T11:11:46.979114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.939418Z","title":"Deep reinforcement learn- ing from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"b199ec23-4265-4028-b0ca-69cb53d6d5c6","year":2017},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.046229Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:a55e690ca1add65be667910cfb8b59b75bce4b3b1b33f4635e34445c011db92a","observation_id":"7d4bee5d-5850-4a70-884f-3bf4e00f7f47","resolution":{"observed_at":"2026-08-07T11:11:51.007382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.616980Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"77bab53b-49ed-4ffb-8dad-dfb682450dd6","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.127378Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:96321b8aa057432a2904760f486328e832f5365bcfc90bca173090d756292386","observation_id":"658122ca-daf3-4bc7-a0ad-804fd2eb11c1","resolution":{"observed_at":"2026-08-07T11:11:50.797671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.349952Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"37c86a2b-73bb-4caf-8a30-691aee10e6c7","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.230549Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:d0856744c00478557dcdee7425d5542d06121616911340e8c7c3c5b0c7a7de8f","observation_id":"e9c7f30d-34c8-4991-8b0f-56f0c395b6bc","resolution":{"observed_at":"2026-08-07T11:11:50.533904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:47.315267Z","title":"From gener- ation to judgment: Opportunities and challenges of llm-as-a- judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.315267Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:72bf1e114d79288a0a0a1b48e2701c058a9604643eefaf1274c377e93b360f9e","observation_id":"0a2d819d-b698-43dc-bfaa-8625d3a61fd5","resolution":{"observed_at":"2026-08-07T11:11:47.315267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T11:11:47.407418Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.407418Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:7e6a497e5ea719ec87fcec5c1f125dac45d1c4a72ba7385a28cbf05d10dfedd1","observation_id":"2851502b-aa0c-47f8-bb4b-5bbecad3798b","resolution":{"observed_at":"2026-08-07T11:11:47.407418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:47.487075Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.487075Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:71f5e570d21578c6b19a7f0fbafa8b56f20688b689632af6416159f60340d6dc","observation_id":"6492f508-04b4-4ca8-9b5f-0aecedd78d40","resolution":{"observed_at":"2026-08-07T11:11:47.487075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04575","last_updated":"2025-01-08T15:45:21Z","snapshot_observed_at":"2026-08-05T04:06:23.326388Z","submitted_at":"2025-01-08T15:45:21Z","title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04575","snapshot_observed_at":"2026-08-07T11:11:47.579318Z","title":"Infiguiagent: A multimodal generalist gui agent with native reasoning and reflection.arXiv preprint arXiv:2501.04575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.579318Z"},"links":{"cited_paper":"/paper/2501.04575","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:b5ca765cc2d14267d52c4ae7649245e168c5a8ddb8251c14f387e301e711b491","observation_id":"3d6fae3a-0208-4387-b14c-424fea65d435","resolution":{"observed_at":"2026-08-07T11:11:47.579318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.073418Z","title":"Hello gpt-4o","venue":null,"work_id":"8c2e5f30-73c5-47ad-bdd5-4e9749204926","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.641146Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:a976b23dca10f9bebfdd6379fd211d5c5ae0139214c73995a19aa2c8331d86cc","observation_id":"b84ccf14-510c-4c8b-894c-088bc0000284","resolution":{"observed_at":"2026-08-07T11:11:50.238584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.822921Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"48278555-475e-4d92-82d6-914e13e8800a","year":2022},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.702656Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:82a106757259155b8d00f7c7530d46fce163fb7ab145cf6ffad9817931568de8","observation_id":"d39b2950-ae32-43f9-99d1-9a49b6d4d6cd","resolution":{"observed_at":"2026-08-07T11:11:49.985964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T11:11:47.763545Z","title":"Ui-tars: Pioneering automated gui inter- action with native agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.763545Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:ceb54d950a0776da4a4a57659ba3d64bec70bee32d770bc653ce01870f4d8de4","observation_id":"4d16142b-d8d2-4b88-b24d-c4fd0f912613","resolution":{"observed_at":"2026-08-07T11:11:47.763545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.586412Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"cff95801-71e6-4539-940f-5ddf2ec80efa","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.819248Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:06a6470dea9cb42c94158b934c2278b4a18fab35793538e2e98d1111030716ad","observation_id":"bef87bf5-1916-4d8e-bc38-e68ae7ee8514","resolution":{"observed_at":"2026-08-07T11:11:49.695754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.391934Z","title":"Androidinthewild: A large- scale dataset for android device control","venue":null,"work_id":"afebe5b3-8846-4a67-9f82-d536ea715bda","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.869310Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:409564e4c6a3fb4ba045917df40ffbd75ad95c6b46f998968fb12f6a4d3bc7a0","observation_id":"c0f62f9f-6d31-4201-bc4e-345989574692","resolution":{"observed_at":"2026-08-07T11:11:49.492838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:11:47.932567Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.932567Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:18582da6415125a35a24e3a1c31959c2a7cf4b9ac00029c5b63d67623153829c","observation_id":"85780b80-96e0-4ffa-8e75-495e650e76ea","resolution":{"observed_at":"2026-08-07T11:11:47.932567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-07T11:11:47.992971Z","title":"mdpo: Conditional preference optimization for multimodal large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.992971Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:3770a1fc22575add86539574d9b1bffbb2fdb891048bb681d4a06870b9483fb9","observation_id":"52fc45d8-d8ae-47c0-8146-e8dab32c6959","resolution":{"observed_at":"2026-08-07T11:11:47.992971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07456","last_updated":"2024-02-15T09:30:48Z","snapshot_observed_at":"2026-08-08T22:28:54.714585Z","submitted_at":"2024-02-12T07:29:22Z","title":"OS-Copilot: Towards Generalist Computer Agents with Self-Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07456","snapshot_observed_at":"2026-08-07T11:11:48.072942Z","title":"Os-copilot: Towards generalist computer agents with self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.072942Z"},"links":{"cited_paper":"/paper/2402.07456","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:080d4ce267302562663a48c2c147867d006fdb3144ea5af00f84dae50e8f04f2","observation_id":"13a7da60-6ed7-43cf-b502-223ebe2c8838","resolution":{"observed_at":"2026-08-07T11:11:48.072942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.217682Z","title":"Osworld: Benchmark- ing multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"eb20dca8-4ebd-4988-a2b2-be33be322e04","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.154432Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:5640edd67bf96d8fc60c8a71ed50bc1dc8f990fde993544cdd51265cebb94b03","observation_id":"2c4b1f6a-fc90-4e32-b79d-28036744c2b8","resolution":{"observed_at":"2026-08-07T11:11:49.294060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-07T11:11:48.195477Z","title":"Aguvis: Unified pure vision agents for autonomous gui interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.195477Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:46c778096da0f5bc0230e9fba06dfcbc6bbcba521cf669f123c8d526e4f84f3c","observation_id":"b940e2a0-ab9d-487c-ae4c-5a991da57c58","resolution":{"observed_at":"2026-08-07T11:11:48.195477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-08-07T11:11:48.250484Z","title":"Gpt-4v in wonderland: Large multimodal models for zero-shot smartphone gui navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.250484Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:bbc056070921a2d281b10e599f523b4ba02a4f534517843e5143b3e03e351d73","observation_id":"f3e53efa-5ea7-40c2-a989-a6f99ef929aa","resolution":{"observed_at":"2026-08-07T11:11:48.250484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T11:11:48.321722Z","title":"Direct preference optimiza- tion of video large multimodal models from language model reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.321722Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:88e5af7152a8213ff4d45d77e5c9a731378e246da6e844238bc0a46ee095e8d1","observation_id":"a6d1d13c-c917-42b2-b910-fd47e5cd3e2d","resolution":{"observed_at":"2026-08-07T11:11:48.321722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.001392Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded","venue":null,"work_id":"0f8a8315-99e1-47c2-bf32-71ec0d0220ff","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.389540Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:e3b38f39bb949a5125fc2af4b79dcb1c6b985eb6a3ef0a928fa0b45678295bf7","observation_id":"2e782ce6-1f08-47c5-ab9b-cc56e749039c","resolution":{"observed_at":"2026-08-07T11:11:49.083792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:48.864346Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"6ab39fee-5107-44cd-a6ce-1c6bad6d60fb","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.452167Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:ecc2f79a76a684e88728fefac280a874a6bff413a6bb1fa1a0997614d0d14871","observation_id":"2a5c22b9-21d8-49cf-93b3-dda022dd0684","resolution":{"observed_at":"2026-08-07T11:11:48.925875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-07T11:11:48.502654Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.502654Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:ae6fb2b96e00bdc72d003abec3f825b517ae11444f9d5ed74c3a5e8b32a1ce6d","observation_id":"b83d7520-3411-4e9f-a70c-3042e5b5d92c","resolution":{"observed_at":"2026-08-07T11:11:48.502654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T11:11:48.561600Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.561600Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:e512392bed49d9d1a42a8de2e47b3d7d0ac466c55f9b08e67e96e914f8e91e83","observation_id":"552f0184-948a-4b4d-b4b4-5ce9554e9345","resolution":{"observed_at":"2026-08-07T11:11:48.561600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:06:35.897879Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2506.03095."}