{"as_of":"2026-08-09T11:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:315957cfde4cc733e3569c398311a7bbe7a9266c0dcd406113d274f225bef939","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:29:43.716173Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05903/citation-record","integrity":"/paper/2608.05903/integrity","json":"/paper/2608.05903/citation-record.json","paper":"/paper/2608.05903"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-07T21:29:43.488719Z","title":"V-JEPA 2 : Self-supervised video models enable understanding, prediction and planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.488719Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:faafd8dea12fb9a4daf9705638b6c46e7bc0029ed3d4446d77c6c47d6143e6cd","observation_id":"dadd3b6d-1d1e-4b6a-b770-ea4bf7d1ae17","resolution":{"observed_at":"2026-08-07T21:29:43.488719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.371681Z","title":"How learning by reconstruction produces uninformative features for perception","venue":null,"work_id":"ef4c05eb-aca8-4dd8-a995-4a9bb1ad8183","year":2024},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.494465Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:fe2bf731fae5cca5c18847aa7af18e44497d19b4ecc25118e8c7a784a3380dea","observation_id":"8ba1151d-5371-452e-91b1-460c91d3130c","resolution":{"observed_at":"2026-08-07T21:29:45.376602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.356642Z","title":"Motus: A unified latent action world model","venue":null,"work_id":"5dc2d075-1ad2-4e0e-9eaf-0f728ab14b7c","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.499416Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:c4ac78c1449d95f3133b9c88722b46d6254e7091dcdaa0684c1f9419aeca0e3c","observation_id":"67c7e4a6-42f9-43da-9f18-700d005cdf3e","resolution":{"observed_at":"2026-08-07T21:29:45.361494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T21:29:43.504625Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.504625Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:0696513b810dbe487b79ee14d3ee8d9d492097b042ba1abc33b739c694da2eb2","observation_id":"cbcf53da-3b48-4d9c-b612-f85f6d7918b1","resolution":{"observed_at":"2026-08-07T21:29:43.504625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T21:29:43.510016Z","title":"_0 : A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.510016Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:c8ce7a5190de4c0a02fbe94031488d691431c932c5fdfc7eb608a5762b05cbc5","observation_id":"b8465368-931f-416f-ae67-7bbf6c8fa5a7","resolution":{"observed_at":"2026-08-07T21:29:43.510016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-07T21:29:43.515393Z","title":"Univla: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.515393Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:3d51283e793db55ece967e182e9886b6e154aa9b788bdb61309adc3dd45eaccb","observation_id":"56b810ca-046e-4980-954c-5b311bcfc8e5","resolution":{"observed_at":"2026-08-07T21:29:43.515393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-07T12:15:14.265779Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-07T21:29:43.521672Z","title":"Worldvla: Towards autoregressive action world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.521672Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:4917a92d7cb7864a1367be7553fca7c39fa077b310dea609d09314f8b7e39075","observation_id":"6f0a9ed5-f562-418b-a675-192b48f97cf1","resolution":{"observed_at":"2026-08-07T21:29:43.521672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T21:29:43.527696Z","title":"GR-2 : A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.527696Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:7427c6ce5e107350574c9829b101bb548cddd8ba312b0c49afa54de621e11104","observation_id":"135364b3-2784-41e8-9d24-52bafda93111","resolution":{"observed_at":"2026-08-07T21:29:43.527696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.533071Z","title":"Lawam: Latent world action models for efficient dynamics-aware robot policies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.533071Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:117a9c232544251fb5d6a847b7bad75f4452f1c3de931780386e6dd010116818","observation_id":"b0b2a8ff-6e24-4b6d-8e96-b6f5e0e67d5f","resolution":{"observed_at":"2026-08-07T21:29:43.533071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.341403Z","title":"RoboTwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation","venue":null,"work_id":"a7801660-713e-4f3b-ad4a-10aa5cf3dddf","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.537993Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:6bec0f749de75197791d34e1f37ee5253f034de6c0d1aa546515e55b2623c31f","observation_id":"2ffacfd1-4482-4b49-a70a-5cd92bd93e35","resolution":{"observed_at":"2026-08-07T21:29:45.346238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00111","last_updated":"2023-11-20T05:38:13Z","snapshot_observed_at":"2026-08-05T19:35:53.885395Z","submitted_at":"2023-01-31T21:28:13Z","title":"Learning Universal Policies via Text-Guided Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00111","snapshot_observed_at":"2026-08-07T21:29:43.542728Z","title":"Tenenbaum, Dale Schuurmans, and Pieter Abbeel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.542728Z"},"links":{"cited_paper":"/paper/2302.00111","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:b950b2bbc479eab77dd8feb30258654b6b0450735dee529bfe244d8731d39348","observation_id":"3bd500e6-51b0-47d0-882e-422d7ff40af0","resolution":{"observed_at":"2026-08-07T21:29:43.542728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.325938Z","title":"LIBERO-Plus : A progressive robustness benchmark for visual-language-action models","venue":null,"work_id":"dfbb48c5-4bfc-45b2-964f-4847bff3cc6e","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.548420Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:e40e3f296b5abc52eb4df80c6e5e00cbc9477adf436e5b0385e26ee8bcdfcc11","observation_id":"18d058b1-3269-4626-80b5-e1637d3d6e1c","resolution":{"observed_at":"2026-08-07T21:29:45.330846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3570","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:44.305284Z","title":"Prediction with action: Visual policy learning via joint denoising process","venue":null,"work_id":"bf84c818-678d-4e47-8e30-fb60b436b68a","year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.553241Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:009bbe8fa34d80fc59dbb4c816872469c06c36d040aa7c0320272fb4261fe03c","observation_id":"e4a5a6e6-f6af-4c24-b4b6-ae5c5c1629d6","resolution":{"observed_at":"2026-08-07T21:29:44.311700Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-07T21:29:43.558466Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.558466Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:40216dda8602c93edc5a09935010b6273e840919e6fa98c06872b046e0401aae","observation_id":"69075a04-26df-48e9-8831-73f59973086e","resolution":{"observed_at":"2026-08-07T21:29:43.558466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-07T21:29:43.564353Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.564353Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:8c02c0d4badefb5ce902bfec63f3df49948d8d40197e91847d86553b0e014fc2","observation_id":"aaf21366-9a54-4ea4-b04b-31ab8df9d148","resolution":{"observed_at":"2026-08-07T21:29:43.564353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T21:29:43.569686Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.569686Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:3c07d5be893f8c6c6c809130aaa77777dedbd6f299253c12ac1f65e3fefb8489","observation_id":"e979e249-19c7-4436-af7f-26224d5d80cd","resolution":{"observed_at":"2026-08-07T21:29:43.569686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T21:29:43.574878Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.574878Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:9eef27fcdcbb0c0f633af07aa294cf16f93dfb79341fe0d1a13efc7f165e0718","observation_id":"2ddaa7be-70ad-45ff-b1e0-ef7034bb8605","resolution":{"observed_at":"2026-08-07T21:29:43.574878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-07T21:29:43.580212Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.580212Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:693d4162683fc65f692922ca7c196c9c004f10d2fbb826eac59d26a9ab6e3dea","observation_id":"6c9121e4-53e6-4af8-a727-a5f60cdb86b7","resolution":{"observed_at":"2026-08-07T21:29:43.580212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.310393Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":"e8a9a339-f5b7-4c5d-a762-d2fe34794d3d","year":2022},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.585251Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:61122f9059868906cd7f7e59da7ba931a93dc0c537c966e422c2a082fe974cc8","observation_id":"5b3f109b-375b-4acf-9ce0-380e1c369dd7","resolution":{"observed_at":"2026-08-07T21:29:45.315551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.590006Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.590006Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:319ae4fe705ccd0061a866cb081e8a313be936a574985af4e1d00ea694aee319","observation_id":"b2bff3e5-3f04-4815-9ee6-cba247f546c2","resolution":{"observed_at":"2026-08-07T21:29:43.590006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-07T21:29:43.594969Z","title":"Causal world modeling for robot control","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.594969Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:024c4c4be93a3906b13e2e0796965af8bb55980aac66572ac95ea1f0fc16f6b6","observation_id":"8d18da9d-e4db-420e-a168-b1ae82dfbf52","resolution":{"observed_at":"2026-08-07T21:29:43.594969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.293519Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation","venue":null,"work_id":"5de03be2-eb40-4858-9d23-125d5f7b6f36","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.600028Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:3bff27117351be225974d6c1f91671ef2d9dcaee2d1912c59c480b25f27bbe9d","observation_id":"5d463649-3d59-4d5c-a815-917a523b357b","resolution":{"observed_at":"2026-08-07T21:29:45.299234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.276235Z","title":"Chen, Zhenyu Li, Yang Zhao, Sida Peng, Hengkai Guo, Xiaowei Zhou, Guang Shi, Jiashi Feng, and Bingyi Kang","venue":null,"work_id":"b2164c7c-1d23-4776-a2bf-fcf7a7b2af74","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.604606Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:02f17922472033047eb14397b4221e1519cd2cae16b0a55fb00270a67d480ba7","observation_id":"484e99f4-7de3-420f-b40b-9a269da36c44","resolution":{"observed_at":"2026-08-07T21:29:45.281049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.610111Z","title":"Evo-0: Vision-language-action model with implicit spatial understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.610111Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:a3014c6eb8dfeb61bb270d8fd8cf79be6ca99679ed45795d0f2c2a3184941e98","observation_id":"35228cce-0c13-41cd-b502-66962f22d694","resolution":{"observed_at":"2026-08-07T21:29:43.610111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-07T21:29:43.616014Z","title":"LIBERO : Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.616014Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:de56d8abb0c450e7534ce3bb329fd310c6c285274c415491c5ddb3c6b2a24c5a","observation_id":"c5f95cb0-6da5-40e4-8c07-356643e01408","resolution":{"observed_at":"2026-08-07T21:29:43.616014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.260318Z","title":"LDA-1B : Scaling latent dynamics action model via universal embodied data ingestion","venue":null,"work_id":"9230cd17-090a-45ed-84e7-5e89e452bba5","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.621120Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:86ad893b11e052239cb531870a50c9adcaa6e2c2f4ee76ba6c08fdb9463ad524","observation_id":"bba2533d-7393-4b83-bee3-32a207305913","resolution":{"observed_at":"2026-08-07T21:29:45.265287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06388","last_updated":"2026-05-07T15:05:26Z","snapshot_observed_at":"2026-08-02T19:03:40.916172Z","submitted_at":"2026-05-07T15:05:26Z","title":"Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06388","snapshot_observed_at":"2026-08-07T21:29:43.626179Z","title":"Reconstruction or semantics? what makes a latent space useful for robotic world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.626179Z"},"links":{"cited_paper":"/paper/2605.06388","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:5f7237ee516d42402aebf1fad08891a463f3be2b5c3aaf795269f08af225e7fc","observation_id":"6e6c2f75-f6ba-4715-a0b7-6ec689ab69e9","resolution":{"observed_at":"2026-08-07T21:29:43.626179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T21:29:43.632134Z","title":"Cosmos world foundation model platform for physical AI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.632134Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:4a9f3d5b7fee8b68b9d192daec394c51fa86816be2a5f5d5a6856ffeceb1e457","observation_id":"8a6b5351-b1b3-4634-a68d-ee386ca31903","resolution":{"observed_at":"2026-08-07T21:29:43.632134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.245055Z","title":"mimic-video : Video-action models for generalizable robot control beyond VLA s","venue":null,"work_id":"9ff3cdf3-75e0-4ca9-884b-94247bef443e","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.637880Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:67812953539c7c565588ddd03a8be7ef4b8404115e771c6b15050c075f86e3ba","observation_id":"a7c5c887-27b3-42af-8531-54ab99f2afb5","resolution":{"observed_at":"2026-08-07T21:29:45.250028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T21:29:43.642917Z","title":"Fast: Efficient action tokenization for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.642917Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:dbb297dbbc8f1d158687d22fd2a6dc9d75ddd3f8407a2dffcb2b2ced37724921","observation_id":"45e213d6-5519-44f7-b774-b0ffba8cc5b8","resolution":{"observed_at":"2026-08-07T21:29:43.642917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-03T05:46:19.564000Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"cited_work":{"arxiv_id":"2606.20781","doi":"10.48550/arxiv.2606.20781","metadata_source":"pith","pith_arxiv_id":"2606.20781","snapshot_observed_at":"2026-08-08T00:16:16.039225Z","title":"World Action Models: A Survey","venue":"cs.RO","work_id":"f64306f2-9d9f-495d-8b1e-0b8dee7c00fc","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.648773Z"},"links":{"cited_paper":"/paper/2606.20781","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:8fa597cf740f7303318d485509970a73e27b04ef4d4a09bb01dc72ae5bff7bd8","observation_id":"1d5ba225-53c0-4b10-acb7-8643c2b614ff","resolution":{"observed_at":"2026-08-07T21:29:44.227018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-07T21:29:43.653607Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.653607Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:61453a2281cb02fe841cb99ecd4d565fb156f53fad2d86a0623ae645adb8f935","observation_id":"f9fc0cc1-0cf8-45a8-82fe-d6c7cfa93588","resolution":{"observed_at":"2026-08-07T21:29:43.653607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T21:29:43.659139Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.659139Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:03a576a0bf94ca6463d1ca5f0d9238ff77516a4b60a826ab5acafc4a50565a3f","observation_id":"4c9ccf9c-871d-480e-8855-c032bec94dbf","resolution":{"observed_at":"2026-08-07T21:29:43.659139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-07T13:41:22.723759Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13674","snapshot_observed_at":"2026-08-07T21:29:43.664306Z","title":"Repwam: World action modeling with representation visual-action tokenizers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.664306Z"},"links":{"cited_paper":"/paper/2606.13674","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:9772a4dae5ea320bbf8ea4d64d13c429fc915ff9427eadbbb58ad46dae7493ee","observation_id":"70242a4d-714c-4206-8fc4-75da2e9c50d3","resolution":{"observed_at":"2026-08-07T21:29:43.664306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-07T21:29:43.669451Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.669451Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:ea5a91bd99bfa226545b6c9fb7aab57549cfbe4ac790d02053301520be1edeba","observation_id":"c0f16bc5-cec3-45d6-a1d0-3ae8a8e9c9dc","resolution":{"observed_at":"2026-08-07T21:29:43.669451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.674610Z","title":"FutureVLA : Joint visuomotor prediction for vision-language-action model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.674610Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:2df0928b3b3821c1f395f9f8c7db3e38fdf1317d9feb0927469995e59b77993c","observation_id":"bc730da9-3530-4efa-a002-acdfeaf777a3","resolution":{"observed_at":"2026-08-07T21:29:43.674610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11757","last_updated":"2026-04-13T17:30:01Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:30:01Z","title":"StarVLA-$\\alpha$: Reducing Complexity in Vision-Language-Action Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11757","snapshot_observed_at":"2026-08-07T21:29:43.679501Z","title":"Starvla- : Reducing complexity in vision-language-action systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.679501Z"},"links":{"cited_paper":"/paper/2604.11757","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:b8dc9007b680b071247b1020c6ebcd841c606a08451d54cfc4babd7ee1799ca3","observation_id":"c9e95fc0-2622-4818-b152-dc9f2caa9c45","resolution":{"observed_at":"2026-08-07T21:29:43.679501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-07T21:29:43.684315Z","title":"World action models are zero-shot policies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.684315Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:a5d60cb15b04263cf7545fb1f9da20c38573c1e7ace301ebad5a138485f4d460","observation_id":"d783d34e-8678-412a-9584-b9dd2fee7951","resolution":{"observed_at":"2026-08-07T21:29:43.684315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-07T21:29:43.689632Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.689632Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:28bfadd289f58a35bbf73cbe6215f8be401acfa9cd313b91c3c08c0d7f4d9d38","observation_id":"f0731e72-1a6e-4ac6-beac-77035d03771e","resolution":{"observed_at":"2026-08-07T21:29:43.689632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-07T21:29:43.694843Z","title":"Fast-WAM : Do world action models need test-time future imagination? arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.694843Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:665d15855c029c109cccba5d14e9e8d75a6c08cc49feafbb0d05e57338b68356","observation_id":"0eb8c335-7f3d-4abd-ad28-b1d3514f7ac1","resolution":{"observed_at":"2026-08-07T21:29:43.694843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22078","last_updated":"2026-07-30T02:24:57Z","snapshot_observed_at":"2026-08-02T23:16:34.942315Z","submitted_at":"2026-03-23T15:13:15Z","title":"Do World Action Models Generalize Better than VLAs? A Robustness Study","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.22078","snapshot_observed_at":"2026-08-07T21:29:43.700343Z","title":"Do world action models generalize better than VLA s? a robustness study","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.700343Z"},"links":{"cited_paper":"/paper/2603.22078","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:99469fcbdd1e408c99bb6342bc11952824000f9eed5bbc8b4020827b84b17e28","observation_id":"972d75d3-a521-4eec-ad7b-3cbac8e87c5d","resolution":{"observed_at":"2026-08-07T21:29:43.700343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.706111Z","title":"FRAPPE : Infusing world modeling into generalist policies via multiple future representation alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.706111Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:9ee49adf3c7e640431d9ee450d84dcfc276267b2f6b8d5c2b490afcacf9a1812","observation_id":"1aa7da12-0faa-48c7-9e0c-df2d820ee8ab","resolution":{"observed_at":"2026-08-07T21:29:43.706111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.228823Z","title":"FLARE : Robot learning with implicit world modeling","venue":null,"work_id":"e933186c-cb8c-43d1-8b2c-579cb1992400","year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.711111Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:66b3ceb5939e99525ca4c66ad8574ad41bbfdaff8cae1fcb55a92d00f0ba0dc6","observation_id":"950b22d0-2f92-41c5-be7a-dd5a3ef26c9c","resolution":{"observed_at":"2026-08-07T21:29:45.234084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.211930Z","title":"DINO-WM : World models on pre-trained visual features enable zero-shot planning","venue":null,"work_id":"3dc30914-372c-424f-bb65-ce2749248c71","year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.716173Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:d502ff1e1805f86f51b8d16b0189c0a160ba984839ec6d40d9ef0106d27f4bcb","observation_id":"184a69f5-7483-4c00-8570-8027a257c82f","resolution":{"observed_at":"2026-08-07T21:29:45.217189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:14:20.297576Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.05903."}