{"as_of":"2026-08-18T21:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0c241eea36402fa99f2ffb4e38edd623301ce2cb045aad5ff01a1f38a8ec9d3","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:04:11.999325Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:17:24.951028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T14:52:36.313517Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-07-30T12:43:44.703075Z","title":"Xiaomi-Robotics-1: Scaling vision-language-action models with over 100K hours of real-world trajectories","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23782","last_updated":"2026-07-26T17:58:47Z","snapshot_observed_at":"2026-08-15T03:59:39.322668Z","submitted_at":"2026-07-26T17:58:47Z","title":"$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-30T12:43:44.703075Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2607.23782"},"observation_digest":"sha256:43a7223fbb69fa15b0ead0654afda8b869201a765a93ca064b40c6d4c25051ba","observation_id":"a0aac408-4465-4ad5-a4a1-9ef4b06df91e","resolution":{"observed_at":"2026-07-30T12:43:44.703075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-07-30T12:42:18.603531Z","title":"Xiaomi-robotics-1: Scaling vision-language-action models with over 100k hours of real-world trajectories","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23783","last_updated":"2026-07-26T17:58:53Z","snapshot_observed_at":"2026-08-18T02:45:51.962830Z","submitted_at":"2026-07-26T17:58:53Z","title":"$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-30T12:42:18.603531Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2607.23783"},"observation_digest":"sha256:8cf386f8ac8bdba30a0e85fb9056e3b22a6d565b96c1dee6843d7e44286f81c9","observation_id":"4807410a-d1a0-4b83-b8e9-f36242eb9ed9","resolution":{"observed_at":"2026-07-30T12:42:18.603531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-15T15:17:24.951028Z","title":"arXiv preprint arXiv:2607.15330 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01066","last_updated":"2026-08-02T08:06:20Z","snapshot_observed_at":"2026-08-18T03:12:39.390617Z","submitted_at":"2026-08-02T08:06:20Z","title":"OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:17:24.951028Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.01066"},"observation_digest":"sha256:41bf51c733a61b7e971776ad6ec46b2a40955a6d6d58e49fd08d014a144e45ec","observation_id":"93313b23-be72-440b-899f-91968f484b7d","resolution":{"observed_at":"2026-08-15T15:17:24.951028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":"2607.15330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-05T14:52:36.313517Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","venue":"cs.RO","work_id":"9145c54c-7ea5-4966-aa4f-420966ceffa2","year":2026},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-14T06:43:08Z","snapshot_observed_at":"2026-08-18T21:09:48.188136Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.371109Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:753f809cefce957051cc05531470a0a83e487b70bba72c34d01e384b0a021767","observation_id":"26a539bc-f8cc-403b-84fe-ecb4a2e103a7","resolution":{"observed_at":"2026-08-05T14:52:36.316445Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-15T14:52:22.178974Z","title":"arXiv preprint arXiv:2607.15330 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-14T06:43:08Z","snapshot_observed_at":"2026-08-18T21:09:48.188136Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:52:22.178974Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:990e15c7363d881baa699fbcff937a0ea300c1da07308ce677b97abdbdb30dc9","observation_id":"35032d6b-ae97-4ea2-bd59-3487dbbc969a","resolution":{"observed_at":"2026-08-15T14:52:22.178974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-11T04:54:24.134310Z","title":"Xiaomi-robotics-1: Scaling vision-language- action models with over 100k hours of real-world trajectories,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09892","last_updated":"2026-08-11T17:41:52Z","snapshot_observed_at":"2026-08-16T15:34:10.165022Z","submitted_at":"2026-08-10T17:41:04Z","title":"XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:24.134310Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.09892"},"observation_digest":"sha256:8d782842e68985d7773bae8d68a9dcdd5b1859f4033632b4ad03cc27a125e915","observation_id":"ba3a3086-a292-43c5-88be-b9a14fafaf44","resolution":{"observed_at":"2026-08-11T04:54:24.134310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-14T04:17:47.516551Z","title":"Xiaomi-robotics-1: Scaling vision-language- action models with over 100k hours of real-world trajectories,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09892","last_updated":"2026-08-11T17:41:52Z","snapshot_observed_at":"2026-08-16T15:34:10.165022Z","submitted_at":"2026-08-10T17:41:04Z","title":"XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:47.516551Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.09892"},"observation_digest":"sha256:845290d3d314ede43e9b02b34e371b0565c303aa8ff493738d23993d9c6b3e49","observation_id":"f11a420e-44e5-456c-94a5-f8161ea423b4","resolution":{"observed_at":"2026-08-14T04:17:47.516551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.15330/citation-record","integrity":"/paper/2607.15330/integrity","json":"/paper/2607.15330/citation-record.json","paper":"/paper/2607.15330"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T00:03:59.117791Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.117791Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:87294308ccae6d4b152bca6aea081414ad3cb6084452e062a630804eb06b8991","observation_id":"11bb3548-07d5-4973-9d2d-123330fe7fc0","resolution":{"observed_at":"2026-08-02T00:03:59.117791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-02T00:03:59.225496Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.225496Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:159a4a16fe7aaa10eb3194a81a982998e2cc282a4db44e32846dfce93169f723","observation_id":"605d0126-85e7-43ba-99c7-d5c89b8e032a","resolution":{"observed_at":"2026-08-02T00:03:59.225496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T00:03:59.355811Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.355811Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a70a8b84720e1e6abfec63d13f16e29c0829b24aecc3782afdc2c6d202587fde","observation_id":"7fdce7e2-72af-4e1a-9e39-af8369972acb","resolution":{"observed_at":"2026-08-02T00:03:59.355811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T00:03:59.504446Z","title":"arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.504446Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f39d56513c86ee900c6b64ba0a767a39419edcae12576753742c37718e582702","observation_id":"9a52982e-ab77-4977-b06b-2cd22399abde","resolution":{"observed_at":"2026-08-02T00:03:59.504446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T00:03:59.709806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.709806Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:612fb2f29caabcef32a84a98c697e8fef1da29bf7a155b7a21be5b69681c2010","observation_id":"9a11f851-67fc-4cb7-9c2d-616f550a2ab6","resolution":{"observed_at":"2026-08-02T00:03:59.709806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T00:03:59.879682Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.879682Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:cd1266247dd46aa324b6481990cda7990b5981c96214a1dd758397768140cc1f","observation_id":"a06ac054-a993-41e9-8ea8-a60638044087","resolution":{"observed_at":"2026-08-02T00:03:59.879682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:03:59.955958Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.955958Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:017339781813ebef925bba47e36587a8fa76df4f093df9417ac58633da8555d7","observation_id":"3955dccf-29e0-4ce0-be99-4b7659549687","resolution":{"observed_at":"2026-08-02T00:03:59.955958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:00.063560Z","title":"Xiaomi-robotics-0: An open-sourced vision-language-action model with real-time execution.arXiv preprint arXiv:2602.12684, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.063560Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:e67e3cbf75792dcab874d3f084a507fa32caaebd2a4270d132bb43d38e35e749","observation_id":"94428611-91ed-4eab-9408-eac62345b40c","resolution":{"observed_at":"2026-08-02T00:04:00.063560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-02T00:04:00.143342Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.143342Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:0c35467504b1a2160986454ef8fbb76920cdbc34875a853a4f24623069d267b6","observation_id":"de8021b7-cd0e-472e-bb1b-de885e8a0e0b","resolution":{"observed_at":"2026-08-02T00:04:00.143342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-02T00:04:00.224041Z","title":"Gr-3 technical report.arXiv preprint arXiv:2507.15493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.224041Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:91807be350c6d5eebbab4cba964c975c827536d9e033d0188abbefe46ea6bd18","observation_id":"5aa6b5db-92b7-4149-8ded-902f997da321","resolution":{"observed_at":"2026-08-02T00:04:00.224041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-08-13T20:16:02.364775Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00678","snapshot_observed_at":"2026-08-02T00:04:00.292824Z","title":"Abot-m0.5: Unified mobility-and-manipulation world action model.arXiv preprint arXiv:2607.00678, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.292824Z"},"links":{"cited_paper":"/paper/2607.00678","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9b60766acb0547396045b0880e71ecfb71e44108a28da9ca9fd2c97f205bc654","observation_id":"01b1a5b9-9e36-45b9-900f-ca28e94475f6","resolution":{"observed_at":"2026-08-02T00:04:00.292824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04434","last_updated":"2026-07-05T17:58:02Z","snapshot_observed_at":"2026-08-13T01:18:42.931884Z","submitted_at":"2026-07-05T17:58:02Z","title":"RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04434","snapshot_observed_at":"2026-08-02T00:04:00.390410Z","title":"Robodojo: A unified sim-and-real benchmark for comprehensive evaluation of generalist robot manipulation policies, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.390410Z"},"links":{"cited_paper":"/paper/2607.04434","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:85bb415c9692d7a6e84c55026e43a1069c630a0f22bb63bb51082e91cceecc47","observation_id":"a91aa2f1-0c5a-43bc-9af8-de7a746a5b36","resolution":{"observed_at":"2026-08-02T00:04:00.390410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-18T01:42:20.495799Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08243","snapshot_observed_at":"2026-08-02T00:04:00.468016Z","title":"Training strategies for efficient embodied reasoning.arXiv preprint arXiv:2505.08243, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.468016Z"},"links":{"cited_paper":"/paper/2505.08243","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ec540bd4641c0bdb2abb5232a05b81eaaa0d0ee2bb93d2de0db4eff7101cf5e5","observation_id":"400c7946-e052-4d43-89aa-478c300bdf5e","resolution":{"observed_at":"2026-08-02T00:04:00.468016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-16T15:49:09.216982Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-02T00:04:00.537030Z","title":"Pali: A jointly-scaled multilingual language-image model.arXiv preprint arXiv:2209.06794, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.537030Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:361876de00c97d23ee17ae4808f82b283fadc24e3614cbaa540d110af60bca09","observation_id":"a71c2dc8-c7fa-425f-ba20-905e005dd208","resolution":{"observed_at":"2026-08-02T00:04:00.537030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-15T20:23:49.425816Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22136","snapshot_observed_at":"2026-08-02T00:04:00.633844Z","title":"Wh0: Generative world models as scalable sources of egocentric human hand manipulation data.arXiv preprint arXiv:2606.22136, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.633844Z"},"links":{"cited_paper":"/paper/2606.22136","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ea9194aee51640e01574b4aaf99167143750b722cdc9a32c676b2f3ca42b2e4d","observation_id":"b72ce5ab-7741-470f-975e-0e8edfac7f1c","resolution":{"observed_at":"2026-08-02T00:04:00.633844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:00.778343Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.778343Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:13970915bd9ca522b78164f790a8d033ea8ccbf6a601ebbbfbaa530ed989dbcc","observation_id":"d1e7ee89-44c8-4c46-a6e3-27c88216a173","resolution":{"observed_at":"2026-08-02T00:04:00.778343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-08-18T16:58:44.329929Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-02T00:04:01.022781Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots.arXiv preprint arXiv:2402.10329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.022781Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4115b57406ce5cb43a9fb2e94702a4a0912e6a14a6955bee04c66653eb97bf8d","observation_id":"88f2b9c8-6bb2-4ea0-868c-c7995c5825d6","resolution":{"observed_at":"2026-08-02T00:04:01.022781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:01.112802Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.112802Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f7146d3dd5128f1e6e399360b2c200112069251ce7b62115a04207ed1bc919f5","observation_id":"27d05d05-5854-4299-a7f5-2f22d7fcd3a8","resolution":{"observed_at":"2026-08-02T00:04:01.112802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-08-16T22:33:00.868689Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T00:04:01.196872Z","title":"Molmoact2: Action reasoning models for real-world deployment.arXiv preprint arXiv:2605.02881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.196872Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4be9389cb3d2a40c278beed40eadc7b221b546c95b216e450bf50728d39d0185","observation_id":"b0517684-f747-44da-b962-a8232099456e","resolution":{"observed_at":"2026-08-02T00:04:01.196872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:01.316861Z","title":"Galaxea g0.5 technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.316861Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:d042dd170dc8c49a700d567b504cde9d9d1f425bddf6ec1629e263db84123a7c","observation_id":"35698623-2e34-4d0e-9955-6d5a6314550b","resolution":{"observed_at":"2026-08-02T00:04:01.316861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26694","snapshot_observed_at":"2026-08-02T00:04:01.407672Z","title":"Unified 4d world action modeling from video priors with asynchronous denoising.arXiv preprint arXiv:2604.26694, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.407672Z"},"links":{"cited_paper":"/paper/2604.26694","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:af4dc63c8c8a719492f4fa95301ddd525f905e107207ce6b5bd18e682740a838","observation_id":"3e06fcd5-8fcf-4926-83b2-6d7765aa8b22","resolution":{"observed_at":"2026-08-02T00:04:01.407672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-02T00:04:01.478584Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.478584Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:da168e8324b5c2d1ffbcc6d17128982dc09906faa6f0ef2f186e6f829708fa39","observation_id":"52eb2fbd-0f66-4138-98fb-9e64b0d22fa6","resolution":{"observed_at":"2026-08-02T00:04:01.478584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-02T00:04:01.537382Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint arXiv:2412.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.537382Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:33f78087068861bf69f2310fe0cfa01a92ee6fb94b074ad8cadb3ddb56935ae2","observation_id":"7378915d-97d3-498f-b507-32b18b84e27d","resolution":{"observed_at":"2026-08-02T00:04:01.537382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-02T00:04:01.650486Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.650486Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:c34ab2d30b31d5616d046b06fbafcce513e1d41818a6e953858c6c6178e7ab60","observation_id":"58fa531a-0a35-45ce-b0ba-8f1298fe14ec","resolution":{"observed_at":"2026-08-02T00:04:01.650486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-02T00:04:01.761066Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.761066Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:dd3df88df04f2834c71fd7f28230c4e024556a9fb447c13d1f4a39ac83c0b0e3","observation_id":"a937599b-d17a-48bd-9544-644636988650","resolution":{"observed_at":"2026-08-02T00:04:01.761066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-14T02:52:34.768729Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-08-02T00:04:01.858008Z","title":"Galaxea open-world dataset and g0 dual-system vla model.arXiv preprint arXiv:2509.00576, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.858008Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:89f69b4a233dcd30d0ecc35ac2b74ed90598e76c9e93465bf1e527566473b2a5","observation_id":"32c109cc-2363-4441-9bc7-5cf88537232a","resolution":{"observed_at":"2026-08-02T00:04:01.858008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T00:04:01.934636Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.934636Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:18521106f3b7255416a703336590c4c1b99004f9f5c7cc272b8f2a782023107f","observation_id":"ce86acd5-91d1-4d46-9ab4-d3612851450b","resolution":{"observed_at":"2026-08-02T00:04:01.934636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-02T00:04:02.006714Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.006714Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:49e26225acffb41ca9ce4ee8a924c12bda645fe60a0c6b7057151153cd65e10d","observation_id":"ec8145c4-eb6d-4480-b9c1-d94e833b9b27","resolution":{"observed_at":"2026-08-02T00:04:02.006714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-08-17T21:54:51.802122Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03269","snapshot_observed_at":"2026-08-02T00:04:02.063691Z","title":"Rldx-1 technical report.arXiv preprint arXiv:2605.03269, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.063691Z"},"links":{"cited_paper":"/paper/2605.03269","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2bf2425e0e6f0f63314116c6eba6230def9eb6164f259b4d35fab39b7d989e83","observation_id":"81b2b861-086a-422c-af9b-769064d5ff03","resolution":{"observed_at":"2026-08-02T00:04:02.063691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T00:04:02.186263Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.186263Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5f05c3fe49badfc9985fa585f4a241c3dbf2eb343d83b3c45fa6862f9321448d","observation_id":"4e68fd07-b6ec-4942-850c-7059404b9e2a","resolution":{"observed_at":"2026-08-02T00:04:02.186263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T00:04:02.287670Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.287670Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:111b7cfe15985b19c02ab10d74c05f0996667695f8b0e5aae28c6a265170ec8e","observation_id":"af3d625c-3303-4af3-a624-b3297f6c60d1","resolution":{"observed_at":"2026-08-02T00:04:02.287670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-18T01:37:22.468162Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-02T00:04:02.398602Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.398602Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:236b7355860b3ca306b705fcbe97749bcbf6edca9c6092848c5ee20696ceea3d","observation_id":"2464ccfb-0554-4edd-90d8-cd32a7430533","resolution":{"observed_at":"2026-08-02T00:04:02.398602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:02.581358Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.581358Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:76ab11bb7564407e91defd84cc23d8d1040a1e0715125b9dfd03d126f2a55e59","observation_id":"85a13f53-493d-4e77-a9b1-3d46e3270576","resolution":{"observed_at":"2026-08-02T00:04:02.581358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-08-14T09:44:01.476519Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-02T00:04:02.790902Z","title":"Molmoact: Action reasoning models that can reason in space.arXiv preprint arXiv:2508.07917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.790902Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ab614457356e595f49fab64aed476a4c7c03443a2039fa51e9124e78abdd9e60","observation_id":"72bd1631-89b2-4849-8c71-2a2b582af427","resolution":{"observed_at":"2026-08-02T00:04:02.790902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:02.943489Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model.arXiv preprint arXiv:2510.12276, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.943489Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:cab6426980d1ee0d17b15b730d8644abe1fcb709beed30b0745514b5fcb55a2f","observation_id":"d545d019-ecb6-415e-94db-c9ccff4e2e03","resolution":{"observed_at":"2026-08-02T00:04:02.943489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-02T00:04:03.115676Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.115676Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f5cbc1d623fc1d9bc6ad510d891ad2b1b391ba424209f9b8b692a377eba78855","observation_id":"3804a4ed-233c-4b10-9cda-bec18a3197da","resolution":{"observed_at":"2026-08-02T00:04:03.115676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:03.322392Z","title":"Gr-mg: Leveraging partially- annotated data via multi-modal goal-conditioned policy.IEEE Robotics and Automation Letters, 10(2):1912–1919, 2025","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.322392Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ca8405f887b257cb077c1f982ec0f8e07a94cad1de29bd48ead80d3a477d4722","observation_id":"c8149403-1b63-49f5-ad55-3c20cf0b6c71","resolution":{"observed_at":"2026-08-02T00:04:03.322392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:03.480239Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.480239Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:57783ed0d94ea768c0b77d0aaa6076ae051ba51fa6191fc8f23a4b5f7eedf795","observation_id":"9e33eb75-6072-430c-a5a5-df4184f466bc","resolution":{"observed_at":"2026-08-02T00:04:03.480239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03181","last_updated":"2026-08-13T16:47:10Z","snapshot_observed_at":"2026-08-16T23:12:01.089233Z","submitted_at":"2026-04-03T16:57:06Z","title":"SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03181","snapshot_observed_at":"2026-08-02T00:04:03.686284Z","title":"Multi-view video diffusion policy: A 3d spatio-temporal-aware video action model.arXiv preprint arXiv:2604.03181, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.686284Z"},"links":{"cited_paper":"/paper/2604.03181","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:bba8b9018988650fcfe71b1704f97820a846b8cf38db927f051b70ffaacbcbed","observation_id":"da8e04ef-f768-449a-8b04-c065b67a56a0","resolution":{"observed_at":"2026-08-02T00:04:03.686284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:03.836866Z","title":"Scalable vision-language-action model pretraining for robotic manipulation with real-life human activity videos.arXiv preprint arXiv:2510.21571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.836866Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6ac2f6fd952db4b0b12bf460f059d9a37d2e2a21686b4d9ec695a91f6c2cd137","observation_id":"c26cbcde-3016-4a5e-85ad-d0bc8ccd912b","resolution":{"observed_at":"2026-08-02T00:04:03.836866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-02T00:04:03.991822Z","title":"Unified video action model.arXiv preprint arXiv:2503.00200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.991822Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:0feae005268f2e857c1927e647e5cb76f9f8839f77002bf903d6fdc5c5d4c469","observation_id":"9275040c-f375-47c1-bde7-ebf1aaacd914","resolution":{"observed_at":"2026-08-02T00:04:03.991822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-02T00:04:04.138071Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.138071Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:0ac3f67b9d89bf25315ab3275dcee72509c1213846157618c460ffd5e88d8026","observation_id":"9dc5e2df-7a63-44a3-9226-42faad756336","resolution":{"observed_at":"2026-08-02T00:04:04.138071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-02T00:04:04.293371Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation.arXiv preprint arXiv:2406.16862, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.293371Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:7b53df94c162d79d2491db6c844efa4e160dab59db7510b056d3a07a1d84636b","observation_id":"88dc05cd-c5fc-4fa2-9d21-a6d5acb375d6","resolution":{"observed_at":"2026-08-02T00:04:04.293371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-02T00:04:04.419047Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models.arXiv preprint arXiv:2411.04996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.419047Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f7025c6467aaa672175bcfa7a4fc9cab56eefd4e06277fc2c0153efa7b7ac4dc","observation_id":"27963403-1a86-48a4-9baf-38ec2c91e2b7","resolution":{"observed_at":"2026-08-02T00:04:04.419047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T00:04:04.489716Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.489716Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b44adc4a171ad94ac097114f6d059a641133a275591426833da0623ac917fdbc","observation_id":"65f7c628-ed11-4a50-ba6c-8172d8fdea8f","resolution":{"observed_at":"2026-08-02T00:04:04.489716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06156","last_updated":"2025-09-01T04:21:32Z","snapshot_observed_at":"2026-08-16T12:42:57.699932Z","submitted_at":"2025-04-08T15:51:18Z","title":"ViTaMIn: Learning Contact-Rich Tasks Through Robot-Free Visuo-Tactile Manipulation Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06156","snapshot_observed_at":"2026-08-02T00:04:04.559029Z","title":"Vitamin: Learning contact-rich tasks through robot-free visuo-tactile manipulation interface.arXiv preprint arXiv:2504.06156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.559029Z"},"links":{"cited_paper":"/paper/2504.06156","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:315c172ad3f0aeeaa5b364dc7ccb33abe1e919500086de4bf9f8731484053048","observation_id":"d605c88b-0a22-41c2-9d22-5eec95c27e62","resolution":{"observed_at":"2026-08-02T00:04:04.559029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:04.695444Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.695444Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1fb348656e18a45ef4049fea024342f2d2614797dd13a0e589ff055f7ec81295","observation_id":"ddf314b0-bdca-44ef-99b7-2eac4c1d3ad9","resolution":{"observed_at":"2026-08-02T00:04:04.695444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:04.891865Z","title":"Rdt2: Exploring the scaling limit of umi data towards zero-shot cross-embodiment generalization.arXiv preprint arXiv:2602.03310, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.891865Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1c16b82798fa5e8233efeaaa00a61cec15542db5780ab92e20eb9dd6d0b00a1a","observation_id":"d0da9d55-b206-4473-bd3b-509c8dabff88","resolution":{"observed_at":"2026-08-02T00:04:04.891865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-02T00:04:04.963758Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.963758Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:3ebb1f8e6e4d5c666f851e284f50b500117d988a6acf6b01cb6485b6dbff259d","observation_id":"2ae21ebe-a60d-4db7-aeda-c7554c421de5","resolution":{"observed_at":"2026-08-02T00:04:04.963758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T00:04:05.119524Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.119524Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5119ae5125f366af71803b0e896d957729b7f063da8bbb70d36fb9971a5851c9","observation_id":"5efc2714-0f33-4327-81ef-d8033792d4ec","resolution":{"observed_at":"2026-08-02T00:04:05.119524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.287415Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control.arXiv preprint arXiv:2603.10448, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.287415Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b7aa0e5ea4d764182daa50fe8bbaf1331d96bc30f9057a740dafd364d4d5440d","observation_id":"d9301cf6-8c57-4712-b8bb-df456ef42c4e","resolution":{"observed_at":"2026-08-02T00:04:05.287415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-16T06:47:25.140028Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-02T00:04:05.391932Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots.arXiv preprint arXiv:2406.02523, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.391932Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:625ca1729201e52ec1a6efb2dcb7c43c094607fae47b1357fa1ca8488756a3a3","observation_id":"4fbd697c-610d-4dc3-95ea-c91b01898eb0","resolution":{"observed_at":"2026-08-02T00:04:05.391932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.541501Z","title":"Robocasa365: A large-scale simulation framework for training and benchmarking generalist robots.arXiv preprint arXiv:2603.04356, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.541501Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:3d40f9c424853f5b8a3b255c7f19a10498bc178fec3c8b1d557bc45d5fb129c3","observation_id":"b1b7906b-00a3-40b6-9ede-df5d6eabe242","resolution":{"observed_at":"2026-08-02T00:04:05.541501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.652775Z","title":"GR00T N1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.652775Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:cce4f54e45e99f8ba400a8f682c21792f46d31148ae96c35c23a557ff1f52ecc","observation_id":"19d1673e-9e66-4725-88a3-376012e51931","resolution":{"observed_at":"2026-08-02T00:04:05.652775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.791080Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.791080Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b85d1ad0505525cace7ac85f9ccacd7f787c9249fd79eb2c362db4fc8c9ee17d","observation_id":"4f1eb89b-d28b-4701-bb23-c184692f9990","resolution":{"observed_at":"2026-08-02T00:04:05.791080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-08-02T00:04:05.928505Z","title":"mimic-video: Video-action models for generalizable robot control beyond vlas.arXiv preprint arXiv:2512.15692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.928505Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5b12950a752e9f0d5814155752a28d86c0cf532681348d79c4d3ee3f8a19ae17","observation_id":"adfdcd9a-76f3-4940-aaa1-6db85fa6e05b","resolution":{"observed_at":"2026-08-02T00:04:05.928505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:06.037779Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.037779Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a92853e83c602503b5c3a4c5e81601749246a41bbbb4e36993681706c3cd00fb","observation_id":"3821579b-4c34-4dcd-b8ec-3a79210a916b","resolution":{"observed_at":"2026-08-02T00:04:06.037779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T00:04:06.230214Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.230214Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:bdf19b2b9da6cfbd977738628836d713d352a4ceb6611f6069f0c8790a214c13","observation_id":"b5b906f0-94ed-410b-b654-8cbc2c256d97","resolution":{"observed_at":"2026-08-02T00:04:06.230214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:06.351663Z","title":"Coordinated humanoid manipulation with choice policies.arXiv preprint arXiv:2512.25072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.351663Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:27229265f39bf54818044c3122b39b671031d35f50484e02760a4943c347cf59","observation_id":"be4dad51-fdcd-4991-89a6-6f2bf3f0efbf","resolution":{"observed_at":"2026-08-02T00:04:06.351663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T00:04:06.479669Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model.arXiv preprint arXiv:2501.15830, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.479669Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5b48913155e9a59fe17ae0e92ac825410ae48f05dd99b2ea15340c1282444aed","observation_id":"c7ec629f-4625-414a-9ba2-4c4780ea2f4a","resolution":{"observed_at":"2026-08-02T00:04:06.479669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03784","last_updated":"2026-06-03T08:29:49Z","snapshot_observed_at":"2026-08-13T10:40:55.654755Z","submitted_at":"2026-06-02T15:37:59Z","title":"Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03784","snapshot_observed_at":"2026-08-02T00:04:06.613967Z","title":"Revisiting embodied chain-of-thought for generalizable robot manipulation.arXiv preprint arXiv:2606.03784, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.613967Z"},"links":{"cited_paper":"/paper/2606.03784","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ddf18e6acdb6ec290735e259e6179308ce534cf757b426eb79c9994bf9fa17c6","observation_id":"c3ce2c8f-bff1-4071-9e9f-8baf8f6cca98","resolution":{"observed_at":"2026-08-02T00:04:06.613967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T00:04:06.798973Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.798973Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:591b812b524da2e7776872cedf0a5b46dd7cf4093ec66e42894f3dfd48df0060","observation_id":"526ff66a-1512-4c10-b841-31128f6c2545","resolution":{"observed_at":"2026-08-02T00:04:06.798973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T00:04:06.931913Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.931913Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f117e38e603c3d75bb74dc82f53d057fec038b0d52ea8d87159e9f6cac8163e4","observation_id":"73fbf405-d6d4-4024-bcbc-18c48348837f","resolution":{"observed_at":"2026-08-02T00:04:06.931913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T00:04:07.086788Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.086788Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1068d9d3b3f0c48c07d2bc8dffe7e3bbf9f4e2d74a84c14c52e06cf6afdd0887","observation_id":"54d0cacf-9905-4812-9370-8b6541f3ad95","resolution":{"observed_at":"2026-08-02T00:04:07.086788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.181000Z","title":"Gen-0: Embodied foundation models that scale with physical interaction.Generalist AI Blog,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.181000Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6e883aebf9dbbccf628538786ea6c457e1ea77b2f43f02ff1c136a5d0725c753","observation_id":"ea493c74-4e01-414c-85ec-437ffb62a7fa","resolution":{"observed_at":"2026-08-02T00:04:07.181000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.426810Z","title":"Gen-1: Scaling embodied foundation models to mastery.Generalist AI Blog, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.426810Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:0e0be30bfa1857decdd2528ee159b01f61ae3339ad465263e2b594e1107340e7","observation_id":"2e7129a0-07f2-4ea4-b51d-240ba3d2c36e","resolution":{"observed_at":"2026-08-02T00:04:07.426810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.591352Z","title":"Gene-26.5: Advancing robotic manipulation to human level.Genesis AI Blog, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.591352Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9099008fb015183bf9a2a5db36f98acf2e21360f03c88735792ba860316163d3","observation_id":"fd335565-bdce-4b16-94cf-dafbcb829c71","resolution":{"observed_at":"2026-08-02T00:04:07.591352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27792","last_updated":"2026-07-15T07:09:44Z","snapshot_observed_at":"2026-08-02T15:15:08.869109Z","submitted_at":"2026-04-30T12:34:44Z","title":"Motubrain: An Advanced World Action Model for Robot Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27792","snapshot_observed_at":"2026-08-02T00:04:07.705109Z","title":"Motubrain: An advanced world action model for robot control.arXiv preprint arXiv:2604.27792, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.705109Z"},"links":{"cited_paper":"/paper/2604.27792","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b7300c43a6168b52fed7597a03177da612ce5b5031a4de51be9ed34c3479130f","observation_id":"6408f5d5-3515-41ab-979e-bda2709f60eb","resolution":{"observed_at":"2026-08-02T00:04:07.705109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T00:04:07.846442Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.846442Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2eb763cef79dc518b73277372e8dd635be7b81f2e869a19a975e5857341c8530","observation_id":"05a07c5b-9198-4593-b574-79a2746497dd","resolution":{"observed_at":"2026-08-02T00:04:07.846442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.970461Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.970461Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:68b3f3ab142834da5e9008f5b4edb670a2570e478ffb920fab06c157c06abf3b","observation_id":"3dc7a77b-da8f-4386-9f13-545297db9c9b","resolution":{"observed_at":"2026-08-02T00:04:07.970461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:08.076726Z","title":"Qwen-robotmanip technical report: Alignment unlocks scale for robotic manipulation foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.076726Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1618c9647d7cfe62f3092bb5cff16009dc2d802e32b0ec7167275bb133b4e74d","observation_id":"37642b6d-bc80-4668-8e71-19881e850fcc","resolution":{"observed_at":"2026-08-02T00:04:08.076726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T00:04:08.222348Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.222348Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:d20d31d605e3c54460a272d3247e7e876434d010d9ffdc714a0f77755e620fa2","observation_id":"44c93c5e-71fb-43eb-a527-f39338861437","resolution":{"observed_at":"2026-08-02T00:04:08.222348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10422","last_updated":"2026-05-29T05:31:44Z","snapshot_observed_at":"2026-08-18T13:02:19.993992Z","submitted_at":"2026-03-11T05:11:44Z","title":"World2Act: Latent Action Post-Training from World Model Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.10422","snapshot_observed_at":"2026-08-02T00:04:08.361341Z","title":"World2act: Latent action post-training from world model dynamics.arXiv preprint arXiv:2603.10422, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.361341Z"},"links":{"cited_paper":"/paper/2603.10422","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:21defe6ceb13a8d77c887dcaa902e85288a0b0ae9d7218f3e76e468a86fef8bd","observation_id":"1cb546a4-854a-4567-80b1-5f9eb81dba9b","resolution":{"observed_at":"2026-08-02T00:04:08.361341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:08.546668Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.546668Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:3eec90bd7dc3deb9c4e48087716221b10f7f4aac5f2f1973b86b15b984820d26","observation_id":"e10fc9c9-56a0-4063-b656-35fbd7d67500","resolution":{"observed_at":"2026-08-02T00:04:08.546668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-16T14:26:27.599253Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-02T00:04:08.689523Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.689523Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:31eb86c90db3b40c4a637593fa2a532cca53c5b8551d0aa573295df948ab6e37","observation_id":"5bbb7262-ef3d-492a-be20-e2d399360cd3","resolution":{"observed_at":"2026-08-02T00:04:08.689523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-11T08:52:29.230329Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-08-02T00:04:08.883631Z","title":"A pragmatic vla foundation model.arXiv preprint arXiv:2601.18692, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.883631Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6b4951659be1414e7375ca551d9e3927df4c5150fed522941428d372da173e5b","observation_id":"5ff7846f-3914-4da3-abbe-e85fa1fba95c","resolution":{"observed_at":"2026-08-02T00:04:08.883631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:09.062173Z","title":"Dexumi: Using human hand as the universal manipulation interface for dexterous manipulation.arXiv preprint arXiv:2505.21864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.062173Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b58d858244364a3f89175b2025a5e9174b50b5804e149280a1064079c09a8129","observation_id":"8847c4a0-c647-44d2-ba2c-5483b46002be","resolution":{"observed_at":"2026-08-02T00:04:09.062173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20562","last_updated":"2026-06-18T17:59:51Z","snapshot_observed_at":"2026-08-15T12:19:03.506493Z","submitted_at":"2026-06-18T17:59:51Z","title":"MemoryWAM: Efficient World Action Modeling with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.20562","snapshot_observed_at":"2026-08-02T00:04:09.236077Z","title":"Memorywam: Efficient world action modeling with persistent memory.arXiv preprint arXiv:2606.20562, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.236077Z"},"links":{"cited_paper":"/paper/2606.20562","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:999d1a982f4d448c4bdc4589fa7884e1f29c74c0c4419f3e8c41baece860f534","observation_id":"571a8b58-02ec-4e07-8ad5-b643aa9fdfb4","resolution":{"observed_at":"2026-08-02T00:04:09.236077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:09.365590Z","title":"Gigaworld-policy: An efficient action-centered world-action model.arXiv preprint arXiv:2603.17240, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.365590Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:8fde3fecee35c25db5bc7dd8476dbe3d71ef438df11464e2c644f7c624022144","observation_id":"aeee5494-a31e-4895-9005-01475331ad58","resolution":{"observed_at":"2026-08-02T00:04:09.365590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:09.530949Z","title":"Starvla-α: Reducing complexity in vision-language-action systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.530949Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:900e1f7d0c662fd60403fa4b9cf008fd0a5d4ee9c4e11041b7c53b3cb15e9c97","observation_id":"7419d939-de71-4609-96b3-1baa5e0f54ab","resolution":{"observed_at":"2026-08-02T00:04:09.530949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-02T00:04:09.676504Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.676504Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:d2eba3e8c6a13143ba33c754dfbaf8e5ca9853a5a8cf9cdc36e14ef64c1c6e52","observation_id":"88207e1d-9378-44e1-b8a2-f40c32a463f2","resolution":{"observed_at":"2026-08-02T00:04:09.676504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-16T18:04:11.190386Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30877","snapshot_observed_at":"2026-08-02T00:04:09.858319Z","title":"Wall-oss-0.5 technical report.arXiv preprint arXiv:2605.30877, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.858319Z"},"links":{"cited_paper":"/paper/2605.30877","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:bb9eacf64b2db272b9d3b579f6b7d54a84c7f5889c5c524f8f8b34808ae0f9d8","observation_id":"628babad-8bf5-49a2-b9e3-d20096c08eeb","resolution":{"observed_at":"2026-08-02T00:04:09.858319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-15T14:30:41.084242Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-02T00:04:10.006144Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.006144Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9c5111cf3c7e91ecd2f669974ee424515f5deea154518be4d243bcf68ad89e78","observation_id":"181cbaaa-febe-41b0-b66a-e702b18d0f09","resolution":{"observed_at":"2026-08-02T00:04:10.006144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-02T00:04:10.138148Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.138148Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4bb6513a9b596fa87885aefbd08f2fccd93c9fde84373cc9ffca908d8a0b79a3","observation_id":"395ff754-9e63-40d0-a1d6-14444ec8c58b","resolution":{"observed_at":"2026-08-02T00:04:10.138148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-02T00:04:10.301551Z","title":"Hy-embodied-0.5-vla: From vision-language-action models to a real-world robot learning stack.arXiv preprint arXiv:2606.14409, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.301551Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b3884a46731b6b4aa0ac6a38fbc2f7fb23689bb7d262f0fc4d4c5176e04c6275","observation_id":"20e0fc5f-94c4-43fc-ae96-5be679b4161b","resolution":{"observed_at":"2026-08-02T00:04:10.301551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-02T00:04:10.493281Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.493281Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:abc346708086124709226d0836a1a9d71d0ed270e48aea9b718043686381e440","observation_id":"213f53be-0816-4ac8-8652-76f621b0e5f1","resolution":{"observed_at":"2026-08-02T00:04:10.493281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:10.653923Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.653923Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:eacf12b00cbe2eaea451ab158dc4c78ad66b6d7c968ccc8c3be86b008b57d10f","observation_id":"1a1a8114-70f9-4b9a-8a6b-382661e04863","resolution":{"observed_at":"2026-08-02T00:04:10.653923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06559","last_updated":"2026-07-07T17:58:15Z","snapshot_observed_at":"2026-08-18T08:45:47.925479Z","submitted_at":"2026-07-07T17:58:15Z","title":"RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06559","snapshot_observed_at":"2026-08-02T00:04:10.767303Z","title":"Rynnworld-4d: 4d embodied world models for robotic manipulation.arXiv preprint arXiv:2607.06559, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.767303Z"},"links":{"cited_paper":"/paper/2607.06559","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a4fb62d23bb168a391907c7a9d03a8d36081bddaafab39845a960a8bf0e6cd9f","observation_id":"78a64214-cc8c-46c0-8ab8-8c27ff66a29d","resolution":{"observed_at":"2026-08-02T00:04:10.767303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:10.975158Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.975158Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5a9e7a5eca3a2511034e7e874b6522e0fa6d4e33a9e41cde2012e3033f69e72d","observation_id":"8662e36b-e228-487d-864a-51bc0c18689b","resolution":{"observed_at":"2026-08-02T00:04:10.975158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.125595Z","title":"Fastumi: A scalable and hardware-independent universal manipulation interface with dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.125595Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a2e23900d1740989748d57fb87c97a4889969dcb6beaff7264561e27681b8ede","observation_id":"abd2b7e2-65a0-4fe7-9342-6116df8470fb","resolution":{"observed_at":"2026-08-02T00:04:11.125595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-18T18:18:49.891258Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-02T00:04:11.217040Z","title":"Tesseract: learning 4d embodied world models.arXiv preprint arXiv:2504.20995, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.217040Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:dad5f24da6dcb224910daacf5746aeba1d1ec0975cb7b4286f7b229062fa23c8","observation_id":"7574aabc-55ee-4055-8bc9-af23deb11fc9","resolution":{"observed_at":"2026-08-02T00:04:11.217040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-08-18T08:46:36.907284Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-02T00:04:11.291258Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language-action model.arXiv preprint arXiv:2510.10274, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.291258Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5b342d7eb683cbcdcff57626b863ca057808929e751d2789bc0285e4e93f43ce","observation_id":"8fe5f4eb-12bf-4b5c-bf0c-183af1e848f3","resolution":{"observed_at":"2026-08-02T00:04:11.291258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.427801Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.427801Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:c639b7ed9762c3c66a9bcd85441b4abcdfd4c44187f62d4e3a538115e5f17dc0","observation_id":"b17054e2-dfe6-4555-aa1a-2ee1aaba470b","resolution":{"observed_at":"2026-08-02T00:04:11.427801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.570801Z","title":"Acot-vla: Action chain-of-thought for vision-language-action models.arXiv preprint arXiv:2601.11404, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.570801Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:eb22a67c7bf40a02db97459e2fa0a73e6af67b8e8ba68be78fac48ffecff087b","observation_id":"b9a015f2-28a9-445d-9777-5fd99f0a73e9","resolution":{"observed_at":"2026-08-02T00:04:11.570801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-12T22:44:50.325579Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-02T00:04:11.705089Z","title":"Robodreamer: Learning compositional world models for robot imagination.arXiv preprint arXiv:2404.12377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.705089Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4cbc64ffb2e6d05e1481a40558d038cca8dd55d46e8b41a4ff2c8c248da3e7f5","observation_id":"720928f3-040e-4442-b1ad-e10b739fc6e2","resolution":{"observed_at":"2026-08-02T00:04:11.705089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-08-02T00:04:11.845223Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets.arXiv preprint arXiv:2504.02792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.845223Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:d259a77f933833990e79f40e9f1b6a467f2cb6607867540185bd7d59c822c76d","observation_id":"6f9c9bc2-b575-4938-a372-d6cf0c9f1af9","resolution":{"observed_at":"2026-08-02T00:04:11.845223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.999325Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.999325Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9cb1bada9e8a9ff952bb2131c4dc714856a51f1bba032c33800dc4b09fb9e5b1","observation_id":"9eb94489-b3e8-461a-985b-bc8690f8338e","resolution":{"observed_at":"2026-08-02T00:04:11.999325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.331395Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.331395Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:34ece02997841798a83a3169197c72080aaa6a1f33264d49ea6d995c3c149c5e","observation_id":"d79aef79-964d-4da3-96ab-35e32f332ef8","resolution":{"observed_at":"2026-08-02T00:04:07.331395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 7 inbound Pith citation observations for arXiv:2607.15330."}