{"as_of":"2026-08-11T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5637593c792cf23d48e4eded3685196b21bbb5f41a0f17117b78f67c923e0288","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:46.166368Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21252/citation-record","integrity":"/paper/2506.21252/integrity","json":"/paper/2506.21252/citation-record.json","paper":"/paper/2506.21252"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T22:36:41.369605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.369605Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:0c8e9317d962f2d02afad48638dd2e621da3163bccb0500592caa9b5a0b8fbf6","observation_id":"f06f09b6-722d-4be3-b938-e09a910cd995","resolution":{"observed_at":"2026-08-06T22:36:41.369605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:36:41.438405Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.438405Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:b00d23ea755422c20392b792f03a031799209c21f301035b46769bdc73a0c848","observation_id":"9725d029-a434-408e-b4f7-1a3a251fada7","resolution":{"observed_at":"2026-08-06T22:36:41.438405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T22:36:41.685574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.685574Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:3b214a5e7e356879208ee1eef2d8bc15037c842ccdb52d008605aaf0913897b0","observation_id":"c030d5ff-4f4e-4a31-95cd-2127a6cf995a","resolution":{"observed_at":"2026-08-06T22:36:41.685574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:48.193454Z","title":null,"venue":null,"work_id":"44c16310-a005-4cd3-ba3c-be9fcc038cbe","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.826052Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:f84b10547dec21f8209d14ffc2a4c8ef7558190eb7fb23ee8c0c3f8137b67214","observation_id":"69c1f3e3-825d-45de-a713-bd71074f7788","resolution":{"observed_at":"2026-08-06T22:36:48.332392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-08T09:25:43.689145Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19683","snapshot_observed_at":"2026-08-06T22:36:41.978125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:41.978125Z"},"links":{"cited_paper":"/paper/2505.19683","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:f5805c5187fcdf6da787a416e07a3a62bc461daebf76822aaef668da3877911b","observation_id":"17a169ef-baee-4141-a20b-587776fef169","resolution":{"observed_at":"2026-08-06T22:36:41.978125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-05T18:32:49.850038Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-06T22:36:42.146724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.146724Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:61abc23cfc711f2e18c9502cc48215f5ebc18b12865317f7dbdb27b92371240c","observation_id":"cfbb0d56-e472-4344-ab30-6a7a09779e7c","resolution":{"observed_at":"2026-08-06T22:36:42.146724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02071","last_updated":"2023-11-28T11:23:14Z","snapshot_observed_at":"2026-08-09T10:02:13.123149Z","submitted_at":"2023-10-03T14:13:36Z","title":"Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02071","snapshot_observed_at":"2026-08-06T22:36:42.313802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.313802Z"},"links":{"cited_paper":"/paper/2310.02071","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:cd1fad69f3a4759ddf7727fb0811b1493a1f5f5896e78772dae5c755180bb0aa","observation_id":"2d722460-63ac-4ef0-bdcd-672c1891413e","resolution":{"observed_at":"2026-08-06T22:36:42.313802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15527","last_updated":"2024-02-21T07:09:58Z","snapshot_observed_at":"2026-08-05T08:43:12.035234Z","submitted_at":"2024-02-21T07:09:58Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15527","snapshot_observed_at":"2026-08-06T22:36:42.406234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.406234Z"},"links":{"cited_paper":"/paper/2402.15527","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:e16f63bcc107098ef7205ba45d2c60cee1029bab3fa715c22d3b0a4d07fbbbcf","observation_id":"8b15e6fa-9b30-40d4-8df5-08b7af498f81","resolution":{"observed_at":"2026-08-06T22:36:42.406234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.870320Z","title":null,"venue":null,"work_id":"e97defa5-14e8-4471-852f-06ad60cdec85","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.497421Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:265e5eb583f53f7454208f0f270817e898c47973d8479fd4809ae4348a569e39","observation_id":"bdb8f448-6613-409d-8391-bf6d51358543","resolution":{"observed_at":"2026-08-06T22:36:48.031390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-11T07:36:02.871665Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-06T22:36:42.561879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.561879Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:873aabdc13eb755b4e1ae5144c359973db86dd515ee2aafa56c0383bda4510a7","observation_id":"40593145-71eb-4183-9f85-5f38e66d7558","resolution":{"observed_at":"2026-08-06T22:36:42.561879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.636518Z","title":null,"venue":null,"work_id":"65785f98-3ce4-49e1-a24e-71926d488a76","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.625120Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:f41adde837e8d4edacb84c48284df77bb22eaca37b2a635af9c8786ea83d6add","observation_id":"e650d70f-b58b-4084-ab85-5bdf84073b81","resolution":{"observed_at":"2026-08-06T22:36:47.726733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.420661Z","title":null,"venue":null,"work_id":"0855ecc3-6890-4c83-92ca-21544bc5ab2d","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.687111Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:9af574dba043219f0c68469db1fb3ad34a2e79bbd620332cb1817340aca5f4a8","observation_id":"c4f224b8-47a4-4c60-867b-e6dd639c5596","resolution":{"observed_at":"2026-08-06T22:36:47.536393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:36:42.774037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.774037Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:3370448ae7c77da5995d243ba1cebfd15f97cf299af28936eb31956fd64f1911","observation_id":"d349826a-2549-4668-ab70-27a71dc6a5f6","resolution":{"observed_at":"2026-08-06T22:36:42.774037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.224735Z","title":null,"venue":null,"work_id":"3d982375-9d4c-4fa9-9feb-5e896b956cb9","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.844408Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:3126ab86d516c7bac10775d867364905e1eea72ed4410114e144a7447ba9532d","observation_id":"12488757-e78c-4a47-bf9a-8b41e6bbb716","resolution":{"observed_at":"2026-08-06T22:36:47.296199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-08-09T10:42:58.450567Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-08-06T22:36:42.927894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:42.927894Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:50f678285977688b0ba5d52dfccb8c961a5033ed2b73ac8653ab6856b85d8607","observation_id":"af810d31-6b93-466a-aae4-81e72e25c7fa","resolution":{"observed_at":"2026-08-06T22:36:42.927894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:36:43.013554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.013554Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:821cea606669c516e97cc918679fea7e319a79eed09428685eca6509a3aab23e","observation_id":"11592a68-2150-4cfa-9ff9-147ac89d1dbf","resolution":{"observed_at":"2026-08-06T22:36:43.013554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13746","last_updated":"2024-12-18T11:28:05Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T11:28:05Z","title":"RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13746","snapshot_observed_at":"2026-08-06T22:36:43.134536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.134536Z"},"links":{"cited_paper":"/paper/2412.13746","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:514bb1c39c515514dcfe101f7354af7d2331e5b7e9d63db6849bae2f21bc4f68","observation_id":"563cd57d-4319-48dc-a29a-5bdf892a5138","resolution":{"observed_at":"2026-08-06T22:36:43.134536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-06T22:36:43.222340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.222340Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:da523df423c55ed27c435aca1881f54644384ce0afedd67ffe9b6affa71c9bfe","observation_id":"55131c7c-5202-4653-8ad2-711d937d028a","resolution":{"observed_at":"2026-08-06T22:36:43.222340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.283968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.283968Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:234511972f88947d77cadbb134fe2d9645ae22b26e74128732374d6ec9e909b0","observation_id":"168d3974-78aa-4789-8369-2f46f9d735fc","resolution":{"observed_at":"2026-08-06T22:36:43.283968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.360429Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.360429Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:228d6857affd1e3af2d98d4f88dd564f1bb85442d073296eedb45a1ff43e4872","observation_id":"2d3bb893-9a25-4e4d-848c-60ef6b79823b","resolution":{"observed_at":"2026-08-06T22:36:43.360429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T22:36:43.438047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.438047Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:07793d2c5e355eef7a914f5cdc45fc68dc722c7e6bed696f5dc831ad0cda6913","observation_id":"6c9e2b1f-c263-474e-aa11-0fce5b7db5a9","resolution":{"observed_at":"2026-08-06T22:36:43.438047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-06T22:36:43.531337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.531337Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:1e8f743b9d760c68211e2089f41fe91b5607b7d1678e64c4aced75bde8523437","observation_id":"c4bef8c0-b8c5-474b-8a7d-b23863924a88","resolution":{"observed_at":"2026-08-06T22:36:43.531337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-09T11:38:31.414567Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02584","snapshot_observed_at":"2026-08-06T22:36:43.620059Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.620059Z"},"links":{"cited_paper":"/paper/2502.02584","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:398d2deec2b07fc5f6c1520f947367ce6e95b4fd0382a0785e309fe9fe716d2e","observation_id":"2c681772-ba8e-4653-83e6-f73694c759db","resolution":{"observed_at":"2026-08-06T22:36:43.620059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16033","last_updated":"2024-06-23T06:54:47Z","snapshot_observed_at":"2026-07-06T18:35:35.687129Z","submitted_at":"2024-06-23T06:54:47Z","title":"Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16033","snapshot_observed_at":"2026-08-06T22:36:43.709254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.709254Z"},"links":{"cited_paper":"/paper/2406.16033","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:f8cf5687787907685e1446a80e37bda9d0a85c6c692d776c58aa93a2002e7cc9","observation_id":"027d2cb7-8b0b-4b7a-a572-cc99be388e3e","resolution":{"observed_at":"2026-08-06T22:36:43.709254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04447","last_updated":"2025-04-11T07:10:02Z","snapshot_observed_at":"2026-08-06T02:13:58.479161Z","submitted_at":"2024-12-05T18:57:23Z","title":"EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04447","snapshot_observed_at":"2026-08-06T22:36:43.779856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.779856Z"},"links":{"cited_paper":"/paper/2412.04447","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:d29f8d3f1844d03a55c504c1efcf5c35874412dbf2321d7fe69b38bc4c21762c","observation_id":"0cb8f075-81df-44af-a819-b23870384605","resolution":{"observed_at":"2026-08-06T22:36:43.779856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-06T22:36:43.891326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.891326Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:53de467befd73dad5c77c67460be5df363126e894a8bebff729c57465fb609a9","observation_id":"36cc2361-8787-4bb2-b086-cdebe9bba711","resolution":{"observed_at":"2026-08-06T22:36:43.891326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-10T16:51:29.888256Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T22:36:43.969795Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:43.969795Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:a291c7301f5c1a4820a17043dbde7ce7396cfd385723fb28ef70bebf0ccd1c14","observation_id":"de0dac99-505e-4fda-9f2a-d93267561f42","resolution":{"observed_at":"2026-08-06T22:36:43.969795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19723","last_updated":"2025-06-27T08:25:48Z","snapshot_observed_at":"2026-08-10T23:53:32.316930Z","submitted_at":"2024-12-27T16:21:58Z","title":"OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19723","snapshot_observed_at":"2026-08-06T22:36:44.079391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.079391Z"},"links":{"cited_paper":"/paper/2412.19723","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:da06b09de6f574624e6b188ca48b40e006bfc9e8b5b15deea99ee2de3575d522","observation_id":"3dc86184-7470-46bd-ae30-9af0b0e30b48","resolution":{"observed_at":"2026-08-06T22:36:44.079391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:36:44.193779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.193779Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:029e8d02dcec9034b25c2b4b81c823faf576d27e16f1d1c4ee2daba472ccb056","observation_id":"3bd24895-869d-4623-ae1a-74c79815fa6f","resolution":{"observed_at":"2026-08-06T22:36:44.193779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:36:44.304809Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.304809Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:bfc015f39433e69e768dbb15cfa6ea4f0197008b661d909484a75436c1c48f9d","observation_id":"eaf61ff5-95e3-42b3-8bb5-622ab65d8b6c","resolution":{"observed_at":"2026-08-06T22:36:44.304809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-06T22:36:44.366489Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.366489Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:2791b2041dafd3907e2a2843ab250cc4674cc4821305b0a607b374cd4be194fb","observation_id":"c46d6f02-f238-456e-8f5c-127d2a1518c0","resolution":{"observed_at":"2026-08-06T22:36:44.366489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:44.432191Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.432191Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:e1ba1c0f959f585d6b1a1b71c98e6afe743f3ab34a5909ec89ffbf6791e6884e","observation_id":"9bd1a4cf-3b2f-4787-ad6c-73ff556a3023","resolution":{"observed_at":"2026-08-06T22:36:44.432191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01863","last_updated":"2024-07-02T00:24:01Z","snapshot_observed_at":"2026-08-06T20:08:58.356364Z","submitted_at":"2024-07-02T00:24:01Z","title":"VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01863","snapshot_observed_at":"2026-08-06T22:36:44.501851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.501851Z"},"links":{"cited_paper":"/paper/2407.01863","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:63451626b7788010705eac066a0b09aa24c36543804bcebe20cbf2e824995a68","observation_id":"97b2a971-9d40-41bc-86c7-83e970d60b63","resolution":{"observed_at":"2026-08-06T22:36:44.501851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01622","last_updated":"2024-10-23T15:02:57Z","snapshot_observed_at":"2026-08-09T18:10:25.295507Z","submitted_at":"2024-02-02T18:39:51Z","title":"TravelPlanner: A Benchmark for Real-World Planning with Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01622","snapshot_observed_at":"2026-08-06T22:36:44.505963Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.505963Z"},"links":{"cited_paper":"/paper/2402.01622","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:ea8449678a0a0687ea513baf8308d3acb8ba30849f13ce997a21707e9f8921ae","observation_id":"8e0486c0-ab10-4aaf-a464-eb7c2fc8e9d9","resolution":{"observed_at":"2026-08-06T22:36:44.505963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-11T11:38:42.138003Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-06T22:36:44.585127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.585127Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:31b2e9ecefb18eb4f6a87f3ec0931d5dfe9c6be5471daaa5aab3e2458b58d389","observation_id":"eac92648-2a35-4996-8114-fa90e82c1a78","resolution":{"observed_at":"2026-08-06T22:36:44.585127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.972885Z","title":null,"venue":null,"work_id":"40097a72-cb7a-429d-b347-56d8a6b68432","year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.721148Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:b2559431af9b9fe81228188c34ef2d989bd94e6fa2503e89efa729699ffeef7d","observation_id":"a412a3c8-72dc-466b-9fde-208523838d65","resolution":{"observed_at":"2026-08-06T22:36:47.087466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.775751Z","title":null,"venue":null,"work_id":"3be33692-1d1a-4355-a4e8-59a1fd257880","year":2020},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:44.901469Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:7be165d723c15293802fa47625aaf47d5e1592194999abf466a12a25744b67c9","observation_id":"5d209ea6-adfe-47c5-bf66-a0419f304ee3","resolution":{"observed_at":"2026-08-06T22:36:46.860630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-07T22:31:11.195198Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-06T22:36:45.082095Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.082095Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:3ca1be7df8125bd438a539af690f0724dde704eb8c1a0839f3ccf2e3591af62c","observation_id":"7f309774-b59f-4f7f-be72-d7885afdbca8","resolution":{"observed_at":"2026-08-06T22:36:45.082095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-11T04:05:12.767087Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-06T22:36:45.285843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.285843Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:d56d391372005dc5c68c57d0548656def0da40d2073665eaffbd80291e37f1e8","observation_id":"72928ad8-48a3-482c-9f98-3429532b762e","resolution":{"observed_at":"2026-08-06T22:36:45.285843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05047","last_updated":"2024-10-07T14:05:05Z","snapshot_observed_at":"2026-08-09T14:32:54.387212Z","submitted_at":"2024-07-06T11:07:18Z","title":"MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05047","snapshot_observed_at":"2026-08-06T22:36:45.463037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.463037Z"},"links":{"cited_paper":"/paper/2407.05047","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:08fa7c0f0076482ec5e146b9f1e4cd8444f2a807680cf6a3dbfaa3da3f2fcd2c","observation_id":"b81944de-802d-48d4-8d7c-31505eeed8c7","resolution":{"observed_at":"2026-08-06T22:36:45.463037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02391","last_updated":"2025-05-24T16:15:46Z","snapshot_observed_at":"2026-08-07T12:38:35.693216Z","submitted_at":"2024-11-04T18:56:42Z","title":"Attacking Vision-Language Computer Agents via Pop-ups","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02391","snapshot_observed_at":"2026-08-06T22:36:45.668547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.668547Z"},"links":{"cited_paper":"/paper/2411.02391","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:4cdd8496e0a44765a1e82ea8e92b8430b8cadaa476b65059bcd2f3ad621edad0","observation_id":"8a5f0f52-67b2-4554-a6b8-26260ebf08cb","resolution":{"observed_at":"2026-08-06T22:36:45.668547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15978","last_updated":"2024-08-28T17:49:29Z","snapshot_observed_at":"2026-08-06T06:30:12.135984Z","submitted_at":"2024-08-28T17:49:29Z","title":"WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15978","snapshot_observed_at":"2026-08-06T22:36:45.814121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.814121Z"},"links":{"cited_paper":"/paper/2408.15978","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:933cc412c5c70f230351d55038ab573c2cdcfb7ed445b5f81b6c502e176219f4","observation_id":"9f1ab5c3-d448-454f-9bf4-2ccd1f9dac4a","resolution":{"observed_at":"2026-08-06T22:36:45.814121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09893","last_updated":"2025-04-04T11:45:02Z","snapshot_observed_at":"2026-08-10T16:42:46.103521Z","submitted_at":"2024-10-13T16:06:54Z","title":"RMB: Comprehensively Benchmarking Reward Models in LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09893","snapshot_observed_at":"2026-08-06T22:36:45.894072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.894072Z"},"links":{"cited_paper":"/paper/2410.09893","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:462c50819e05f179f2e9b82c13374d3a8be334fbf99f052080d31290ed6b5e6c","observation_id":"be8ff1ed-8400-433b-aa1e-e13b8a79b760","resolution":{"observed_at":"2026-08-06T22:36:45.894072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-08-11T02:19:21.375691Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-06T22:36:45.933900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.933900Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:fbdffef5e16e1d3a67e0c8bc8ebd3c625290dc7783e5303056eb9fa1f7000bcc","observation_id":"59d6978a-d62d-4dbf-9edc-cd76423a9675","resolution":{"observed_at":"2026-08-06T22:36:45.933900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-06T22:36:45.975203Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:45.975203Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:700dd2ae84b1548e028007b7fc5bcab6bec4fcf33d9d92835c7d014d32b00626","observation_id":"83c0accd-e77a-4a31-b5f9-5fa06e6e5ad1","resolution":{"observed_at":"2026-08-06T22:36:45.975203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.052241Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:46.052241Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:934ecf61dee3f53df535ea296b4a7f577ebb5246549353a500248fe16b3da45d","observation_id":"3493dd4f-8f64-4b55-97a7-1aaf7321bd13","resolution":{"observed_at":"2026-08-06T22:36:46.052241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.166368Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:36:46.166368Z"},"links":{"citing_paper":"/paper/2506.21252"},"observation_digest":"sha256:983b496bb4dfa4f943a064d9f8b3ddada969df46b59b860050ccefdb7d223f56","observation_id":"b1d9ba60-f5b1-496e-bbd3-e045859f0fc6","resolution":{"observed_at":"2026-08-06T22:36:46.166368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21252","last_updated":"2025-06-26T13:36:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:15:45.208022Z","submitted_at":"2025-06-26T13:36:12Z","title":"Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.21252."}