{"as_of":"2026-08-16T03:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f4181b2c18bbffa936f02b932d0fb2675c6f1b7c8e7af02b1ba5c55da5faf46","coverage":[{"denominator":134,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:53:43.109347Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:52:22.229506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T14:52:36.169573Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-02T00:04:10.493281Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.493281Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b5af9e4e9eced2208bdb6cf6af61c3f04c9a37792f3bb0e13599a64c9db951b9","observation_id":"213f53be-0816-4ac8-8652-76f621b0e5f1","resolution":{"observed_at":"2026-08-02T00:04:10.493281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-01T14:13:45.477522Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18840","last_updated":"2026-07-21T08:25:37Z","snapshot_observed_at":"2026-08-13T03:19:07.290094Z","submitted_at":"2026-07-21T08:25:37Z","title":"WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T14:13:45.477522Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2607.18840"},"observation_digest":"sha256:09324f835bbed9de4a23c9fa9481bbce742972e3af928c87194fc350602f19b9","observation_id":"8db9f672-2b78-4965-bdc9-ed2e07dc608c","resolution":{"observed_at":"2026-08-01T14:13:45.477522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-01T11:27:05.790751Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-06T05:25:07Z","snapshot_observed_at":"2026-08-13T20:43:10.291079Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:27:05.790751Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:4b06f20ab43bdad94b70bfa22373a8b63ce59ac1f939c8f3e59c2347a041e7ec","observation_id":"5f426447-1146-4b8f-aa3f-02a2ae4b3f2e","resolution":{"observed_at":"2026-08-01T11:27:05.790751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-04T03:23:47.769490Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-06T05:25:07Z","snapshot_observed_at":"2026-08-13T20:43:10.291079Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T03:23:47.769490Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:6e96f46d632a3b0d3007da2c33a478fc3584aa6c1da3731842708506f8b5685b","observation_id":"a06b5ef1-b49c-47a9-9332-77450d8f000d","resolution":{"observed_at":"2026-08-04T03:23:47.769490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":"2607.08639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-05T14:52:36.169573Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","venue":"cs.RO","work_id":"b5b00ef7-b3e2-4bc3-b3b0-83e371d3332b","year":2026},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-05T05:24:32Z","snapshot_observed_at":"2026-08-15T14:45:21.386253Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.397549Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:0063d6c8698c68e31ac922e2db99df74f4b4dd238dbfa6f8e8e3d28dc43df5c9","observation_id":"cc3e1df8-ad08-4ef1-8d2c-83ae62681b9d","resolution":{"observed_at":"2026-08-05T14:52:36.172453Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-15T14:52:22.229506Z","title":"arXiv preprint arXiv:2607.08639 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-05T05:24:32Z","snapshot_observed_at":"2026-08-15T14:45:21.386253Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:52:22.229506Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:a3c529ad14b4ac5ccdb14fda35591582672d7b8a7d745b8a63458b22b61064f4","observation_id":"5d226029-f286-4af2-9c6a-c2cd1dcc6a45","resolution":{"observed_at":"2026-08-15T14:52:22.229506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-12T15:40:38.447840Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10860","last_updated":"2026-08-13T07:46:45Z","snapshot_observed_at":"2026-08-16T02:09:46.467994Z","submitted_at":"2026-08-11T12:33:51Z","title":"Flex-$\\pi$: A Multi-Stream World-Action Model with Compute Flexibility","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:40:38.447840Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2608.10860"},"observation_digest":"sha256:ab83a4a78f02eca0c6cb0983b5b30d1b31335640fa694c04dfca58ae0c43be0a","observation_id":"a9a3a9a8-6615-4ec5-b52a-6bad37bb2b98","resolution":{"observed_at":"2026-08-12T15:40:38.447840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-15T14:17:54.863870Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10860","last_updated":"2026-08-13T07:46:45Z","snapshot_observed_at":"2026-08-16T02:09:46.467994Z","submitted_at":"2026-08-11T12:33:51Z","title":"Flex-$\\pi$: A Multi-Stream World-Action Model with Compute Flexibility","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T14:17:54.863870Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2608.10860"},"observation_digest":"sha256:232d984b0eb3f5458c74305babe7edec024c48ade0142128ad64a57dbc995109","observation_id":"ab61b01b-3d4e-49bf-ad36-3df8fd7f856f","resolution":{"observed_at":"2026-08-15T14:17:54.863870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.08639/citation-record","integrity":"/paper/2607.08639/integrity","json":"/paper/2607.08639/citation-record.json","paper":"/paper/2607.08639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:30.767598Z","title":"1x world model: From video to action","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:30.767598Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:867e1ae60fbd5ee76c4b4588c06e4d60ef4b5aa1f6494e33318b9dfd37c446d7","observation_id":"4791112d-ba06-4fd9-a343-451533b727d5","resolution":{"observed_at":"2026-08-02T07:53:30.767598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-02T07:53:30.909133Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:30.909133Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1ca2a7720f88714fa1e3a8ec7d287ba4507425129d77aff74cafe94657356aff","observation_id":"951a422a-d594-4079-b942-ae85311b4a1c","resolution":{"observed_at":"2026-08-02T07:53:30.909133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:31.101633Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.101633Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:91cb763f6feafd3fa372b10f5ee1055701bcd56f262b37aeadd4c12353502ad0","observation_id":"bbc95e00-a818-413f-93c3-19e73856b4fa","resolution":{"observed_at":"2026-08-02T07:53:31.101633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:31.222980Z","title":"One transformer fits all distributions in multi-modal diffusion at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.222980Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:db88ab98e6855ed342e62942a5f146d9abe1e84b7591de0c5076c6631e1233e4","observation_id":"2cd86200-62d3-4548-8ef3-4d81f8605793","resolution":{"observed_at":"2026-08-02T07:53:31.222980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:31.412644Z","title":"Navigation world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.412644Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:83fc1fa8eeec6209402030c055ac6d0ceffd1a5546d3f64c4973888c1d8e7963","observation_id":"dbdb3ee5-9578-4c59-9487-76347294ddd6","resolution":{"observed_at":"2026-08-02T07:53:31.412644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05331","snapshot_observed_at":"2026-08-02T07:53:31.587834Z","title":"A careful examination of large behavior models for multitask dexterous manipulation.arXiv preprint arXiv:2507.05331, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.587834Z"},"links":{"cited_paper":"/paper/2507.05331","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:63789399d04667d612ecec822b1c30add089e512ee80a3f20d1563cd029a7150","observation_id":"661be493-7e1b-4b4d-ac65-af3f8d91cd85","resolution":{"observed_at":"2026-08-02T07:53:31.587834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:31.701876Z","title":"Gen2act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.701876Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:2b8e3a6e854cb00dfa462dbfee774898062ed0062e5ad0cf0ab3d0eb0c589f08","observation_id":"7fb6b613-98dc-4318-ad27-8fa5f472e534","resolution":{"observed_at":"2026-08-02T07:53:31.701876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-02T07:53:31.813726Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.813726Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:635d5c9f019a2173936ce0627dc26706c1aaef7a43e1084019291427372e6e6b","observation_id":"4b290628-1729-40e6-8e40-8b147ad68d9a","resolution":{"observed_at":"2026-08-02T07:53:31.813726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:31.925337Z","title":"π0: A vision- language-action flow model for general robot control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:31.925337Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:709a49c714184d8e0b74f218c1e7ca857edcf6601815cbb85344fee681b4eee1","observation_id":"8fe55f92-0a21-4d27-91a8-dc5ecaa0ae52","resolution":{"observed_at":"2026-08-02T07:53:31.925337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:32.103130Z","title":"Perception encoder: The best visual embeddings are not at the output of the network","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.103130Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f282e7602bf83d3b84c68d8e33a5a21079d51567d4fba68c0a58c6190b583c92","observation_id":"70bc8eaa-17af-421d-9d0e-aecc328444be","resolution":{"observed_at":"2026-08-02T07:53:32.103130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:32.228184Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.228184Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:429506e5f7603ce9c174934e4f859678f0b4420b9987a1f6e2ade3d9df355324","observation_id":"173b02f3-5044-43e0-8b79-d68bc036b666","resolution":{"observed_at":"2026-08-02T07:53:32.228184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:32.353839Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.353839Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:7fa6e880e3b198113dcfcb34b283518cd2466d7435bf43869a01c23e897f4c55","observation_id":"f63ad169-2c0f-458d-a837-9b4586a991ac","resolution":{"observed_at":"2026-08-02T07:53:32.353839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:32.457036Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.457036Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1b40948cb5e1f4afe6e1b8dfc9ca23941c7911971bad9751b234be287f9e6110","observation_id":"df20c81a-5b77-48c3-9385-90bd0e439def","resolution":{"observed_at":"2026-08-02T07:53:32.457036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:32.539325Z","title":"Univla: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.539325Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:5d3367e865b271782de221e71a08dda78234000d66709ad0fd399a6d504a703b","observation_id":"78ba5ec1-d789-4736-964b-e4f74c9096c2","resolution":{"observed_at":"2026-08-02T07:53:32.539325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-02T07:53:32.635405Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.635405Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:c5e16f45a528d7027914e1e75032b1dacf2ac010f24f6207fc5737f55b1c85a6","observation_id":"4f057200-c315-4afa-a0f6-e928bcf940eb","resolution":{"observed_at":"2026-08-02T07:53:32.635405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:32.762417Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.762417Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f7c3bef64cdcef7c9f7a9bf68f36cc9db345a700a004a9bd6066d0891fc96424","observation_id":"b5e47953-cdfe-4354-959a-6ff388a7f1de","resolution":{"observed_at":"2026-08-02T07:53:32.762417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-02T07:53:32.972380Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:32.972380Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:ec0fc56d3fd7a9a08baea4a4c359dd148962653f0f151708d85fea11f0dd4e38","observation_id":"c542595a-b5d2-4e11-bb8d-d93f4c9c48fa","resolution":{"observed_at":"2026-08-02T07:53:32.972380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.208987Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.208987Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:ae632d78686fa5b50c14bd4b186a4513ee46392c2536fb4efb23b358e09512da","observation_id":"87e76254-e6e1-4f9c-af6d-42d2924ec169","resolution":{"observed_at":"2026-08-02T07:53:33.208987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-02T07:53:33.250157Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.250157Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:6938eec58fe57c66e8fd351a15465ff2eafcb3a7673de0c16476efdee29ff00b","observation_id":"48a53e59-c3b6-4167-a10d-6352e791a5b2","resolution":{"observed_at":"2026-08-02T07:53:33.250157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.343247Z","title":"Moto: Latent motion token as the bridging language for learning robot manipulation from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.343247Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:a45e388ab54789583ea32a95b90eea4295b8cd0f46490d5ff40f1abeae788241","observation_id":"68cd1546-61f5-4e03-ae66-2cb1a4983959","resolution":{"observed_at":"2026-08-02T07:53:33.343247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.455581Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.455581Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:56eade5b0b5e39a8c4cf18c03df905c9208641354660393800e7bfb920d5116e","observation_id":"5c0b6438-1063-420d-8efa-d80e8f2c297b","resolution":{"observed_at":"2026-08-02T07:53:33.455581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.555398Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.555398Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b645d13f9d14a2a06b608866255373c96504e82812bcd92ee77308219aa2d1ec","observation_id":"0956d37e-3d76-4bdd-9777-5cfe6aa96cf6","resolution":{"observed_at":"2026-08-02T07:53:33.555398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.632405Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.632405Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b3de78176e229a1ce11e61f4e9244e14ed0b5673c4cda0dbf0e16c996c5b8bd0","observation_id":"e3355251-ecad-4f39-9a14-17c6708576a6","resolution":{"observed_at":"2026-08-02T07:53:33.632405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T07:53:33.701654Z","title":"DeepSeek-V3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.701654Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:7e828a3473fb15b9217f14c6e91ab9822ff99a137f6b81a2a0700258f8823160","observation_id":"db9634c2-8b14-4b90-a752-343020cac002","resolution":{"observed_at":"2026-08-02T07:53:33.701654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.811579Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.811579Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:e4d066bfaa99e50c08ba41f1ae6c8491c9781754edbba93df8d2d37b585fbcaf","observation_id":"5ee6ee22-5c0f-454c-9818-256c2d565ee4","resolution":{"observed_at":"2026-08-02T07:53:33.811579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:33.949923Z","title":"Tenenbaum, Dale Schuurmans, and Pieter Abbeel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:33.949923Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:0d08e171c32ced96936f257ba1ee07474dc65e63407bf87e0d1c4a6827670da7","observation_id":"67203d73-3e83-4168-a274-55deb0870641","resolution":{"observed_at":"2026-08-02T07:53:33.949923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:34.096363Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.096363Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:a14e7e2c2d27b2b0b2778a3f95bb24c1d1460140e8112830f0052356d460cc7a","observation_id":"a8ee8f03-e6fe-4179-9d38-634cb7936ed2","resolution":{"observed_at":"2026-08-02T07:53:34.096363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:34.281580Z","title":"Adaworld: Learning adaptable world models with latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.281580Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:42ef77576fb4307fc7c003fae2897faa8bc027fdcbd3e060cf8c33af51954a41","observation_id":"02601879-5d48-4577-aa02-056de2bb3ac6","resolution":{"observed_at":"2026-08-02T07:53:34.281580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07534","last_updated":"2026-07-08T15:33:25Z","snapshot_observed_at":"2026-08-13T19:49:25.794747Z","submitted_at":"2026-07-08T15:33:25Z","title":"Infinite Worlds with Versatile Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07534","snapshot_observed_at":"2026-08-02T07:53:34.387887Z","title":"Infinite worlds with versatile interactions","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.387887Z"},"links":{"cited_paper":"/paper/2607.07534","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:fabd12db4dcca662e284473f698ea9a88cf206942bf41ff8176e5c4dbdbc4e81","observation_id":"31414557-3b5a-48df-9539-53361712d2d5","resolution":{"observed_at":"2026-08-02T07:53:34.387887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T07:53:34.471049Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.471049Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f34e3d0126ced05e6e419c4e378d7dfda86bf56b127271818fb0d03024aba828","observation_id":"5594e99b-04cb-4d29-b8b6-ce12e8f8bc34","resolution":{"observed_at":"2026-08-02T07:53:34.471049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:34.624359Z","title":"Gen-0: Embodied foundation models that scale with physical interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.624359Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:d93bb1823350cc631e07e814a7891b79ef853242fc2dc1ba74fe34a87fc11a7a","observation_id":"377447f0-60c6-49b1-a65e-ea7a9b662a0a","resolution":{"observed_at":"2026-08-02T07:53:34.624359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:34.717834Z","title":"Veo: A text-to-video generation system.Google DeepMind Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.717834Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:8cbcd96ce395a5684d05781efb139e96586dfff8174c2b7768d42caa4b6dbea6","observation_id":"d456176a-001f-4816-9675-8dc7d9e58a8e","resolution":{"observed_at":"2026-08-02T07:53:34.717834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:34.783414Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.783414Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:11ae1588a202ea40beccd59344cb16a1e4fa7bd6db6ae72d2c217cd8d691b510","observation_id":"11107363-8409-4790-985b-b5408eb670ea","resolution":{"observed_at":"2026-08-02T07:53:34.783414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:34.850606Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:34.850606Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b2b8d7ae5a4832ca709626f417aefba9f3715ffad0dc53964ac8717589499c9c","observation_id":"e531a95a-a05c-4509-856e-d9c1561ec51d","resolution":{"observed_at":"2026-08-02T07:53:34.850606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:35.067360Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.067360Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:30d1627339a4d6e15cffc4258e7aed8eaaeb8eb09d70319cfc6d00acf6fb72eb","observation_id":"71dad1a9-48dc-4050-8fb1-e035209393e8","resolution":{"observed_at":"2026-08-02T07:53:35.067360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:35.203877Z","title":"Enerverse: Envisioning embodied future space for robotics manipulation.arXiv preprint arXiv:2501.01895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.203877Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:554107a4af54f53063f99638c8af8d7151f9e03fbd377884facdb6b989b7c2db","observation_id":"f00659d7-765a-4b10-9aaa-7fb2c145c71a","resolution":{"observed_at":"2026-08-02T07:53:35.203877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-15T15:02:59.826496Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-02T07:53:35.349274Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.arXiv preprint arXiv:2506.08009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.349274Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:5e4e454474f3c1bb63dfc901f9c6a4e8c712bb00bf1bc210f2fad9667f0872f9","observation_id":"0c1cec87-a1c5-4d1f-b45b-3c269cfdd711","resolution":{"observed_at":"2026-08-02T07:53:35.349274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-02T07:53:35.510558Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks.arXiv preprint arXiv:2504.19854, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.510558Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:4e19830ee512add9004292027feacb2b6921ae9e2ec443ad20420bfac9e5aae2","observation_id":"838f6c65-afa4-4ae8-ac10-d5ad566ea989","resolution":{"observed_at":"2026-08-02T07:53:35.510558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:35.630848Z","title":"Dreamgen: Unlocking generalization in robot learning through video world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.630848Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f5928e1f712b401c58421eb5ab6405b87342a70913aee9328b8842ea6cacf7dc","observation_id":"a8b627f8-66fe-4e03-93e9-30a69acfd977","resolution":{"observed_at":"2026-08-02T07:53:35.630848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24221","last_updated":"2024-10-31T17:59:55Z","snapshot_observed_at":"2026-08-12T22:10:18.204512Z","submitted_at":"2024-10-31T17:59:55Z","title":"EgoMimic: Scaling Imitation Learning via Egocentric Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24221","snapshot_observed_at":"2026-08-02T07:53:35.817019Z","title":"Egomimic: Scaling imitation learning via egocentric video.arXiv preprint arXiv:2410.24221, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.817019Z"},"links":{"cited_paper":"/paper/2410.24221","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:89b7fbea4803984060a202c05b2b14b9f02e1bef12add8a090accc840544e56b","observation_id":"cd018f2c-8dce-4082-9ca8-512938fd69e7","resolution":{"observed_at":"2026-08-02T07:53:35.817019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:35.956486Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:35.956486Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:bc78f5456d7be52ce10562e0377e2d01b5d9774381a5281dd8f4ea71e4afa91d","observation_id":"3715110f-923c-4af3-a946-8688ce375141","resolution":{"observed_at":"2026-08-02T07:53:35.956486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-13T22:25:02.123367Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-02T07:53:36.030424Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning.arXiv preprint arXiv:2601.16163, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.030424Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f12b31cefb76643a898f62085a68807aad4d03a375dbeac03e4cc54e3f61d430","observation_id":"e3cd8c94-7709-436b-9103-d8fbb27268a2","resolution":{"observed_at":"2026-08-02T07:53:36.030424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:36.126332Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.126332Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:ece6ba7ed8cdefe7ca785d5cb04603f957f09cab3008394b854712afc9ed8b2f","observation_id":"db877293-a587-4338-9c94-88fb5b0c5fd2","resolution":{"observed_at":"2026-08-02T07:53:36.126332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-02T07:53:36.240349Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.240349Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:48f10bdb018cd6d71b181bf923616bbae25f19324cff3dc4d4dcc09cef0fbd56","observation_id":"b9ac1f17-7b7c-4590-b875-da27069294d9","resolution":{"observed_at":"2026-08-02T07:53:36.240349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:36.418771Z","title":"Kling-v3.https://kling.ai/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.418771Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:761a83573f4bd1255df0e5e3d95bb555b526558ec678c15cd477ffa2f92be261","observation_id":"35457b15-2c84-4d68-a52d-b6b55a148913","resolution":{"observed_at":"2026-08-02T07:53:36.418771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:36.629307Z","title":"Tenenbaum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.629307Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:538d9d2a0e050a76f41de20e76e996d2f569ca3ea13420aa01688c5afa701385","observation_id":"3010070b-ad76-4dde-bf44-81e9e50c57c4","resolution":{"observed_at":"2026-08-02T07:53:36.629307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:36.772489Z","title":"Deformnet: Latent space modeling and dynamics prediction for deformable object manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.772489Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:bcf70bf0b836700546601c427336b71f418357aff0c9397b71d92514752541af","observation_id":"08d8643c-362b-4d1c-94a0-8a462344ede3","resolution":{"observed_at":"2026-08-02T07:53:36.772489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:36.911336Z","title":"Cronusvla: Transferring latent motion across time for multi-frame prediction in manipulation.arXiv preprint arXiv:2506.19816, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:36.911336Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:23c0a8a97dec7fb2b159512079b5033157180dac05027114bd4328f2f5ce04c8","observation_id":"7b850f8d-3d07-4bdb-99cf-d413de54096e","resolution":{"observed_at":"2026-08-02T07:53:36.911336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-02T07:53:37.043552Z","title":"Gr-3 technical report.arXiv preprint arXiv:2507.15493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.043552Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:a1b4de07e3bd97bed33400a97454c6af5801115ed9a95e91bb2f2d68f5c7a3e0","observation_id":"136ccabc-bd75-4dd4-9462-ccba1e9d1ac1","resolution":{"observed_at":"2026-08-02T07:53:37.043552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-02T07:53:37.121799Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.121799Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:bddb51502e8ff8a12ea575b1bd5477ecd05a77b5e701496266a386eef3585d4d","observation_id":"adf25337-212b-40a8-8500-0a261b840b74","resolution":{"observed_at":"2026-08-02T07:53:37.121799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-02T07:53:37.201100Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.201100Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f38d0c523a3d8a9b0d6d42610f626fbba7061c0781bded963347720ad04146b5","observation_id":"26f40d42-32cd-4570-a5cd-295f3d141a61","resolution":{"observed_at":"2026-08-02T07:53:37.201100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06627","last_updated":"2026-06-04T18:24:23Z","snapshot_observed_at":"2026-08-13T14:01:28.830519Z","submitted_at":"2026-06-04T18:24:23Z","title":"What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06627","snapshot_observed_at":"2026-08-02T07:53:37.282017Z","title":"What matters when cotraining robot manipulation policies on everyday human videos?arXiv preprint arXiv:2606.06627, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.282017Z"},"links":{"cited_paper":"/paper/2606.06627","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b82728bf32ff33a4d8cab42a1589a3ac4a9dbb6358f5c632062ced6eec87f579","observation_id":"2bff0788-78ef-4e41-b829-aaaea7032dde","resolution":{"observed_at":"2026-08-02T07:53:37.282017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01955","last_updated":"2026-06-01T09:14:51Z","snapshot_observed_at":"2026-08-03T02:17:56.167011Z","submitted_at":"2026-06-01T09:14:51Z","title":"WALL-WM: Carving World Action Modeling at the Event Joints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01955","snapshot_observed_at":"2026-08-02T07:53:37.373566Z","title":"Wall-wm: Carving world action modeling at the event joints.arXiv preprint arXiv:2606.01955, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.373566Z"},"links":{"cited_paper":"/paper/2606.01955","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:c8b7a3ce0038d44cc2256463458a790104ee5666e9703c80cd6a50d350b2fa39","observation_id":"50efdff0-8528-4d59-887c-44622e32f2f4","resolution":{"observed_at":"2026-08-02T07:53:37.373566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:37.474825Z","title":"Unified video action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.474825Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:59ae7c969c36ad14b26c597977592f832eb4a763c8a70222bb0a64d63947bdf7","observation_id":"079318c0-66b6-42d7-a2ce-cc657409964b","resolution":{"observed_at":"2026-08-02T07:53:37.474825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:37.538592Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.538592Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:d170c520127a1f8a51fb25aadcf420e293e0c488bf6ba45ff556fab241c248e7","observation_id":"b4d043cd-2f67-4947-abbc-d27ff2982657","resolution":{"observed_at":"2026-08-02T07:53:37.538592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:37.600551Z","title":"Propagation networks for model-based control under partial observation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.600551Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:efb681ac913cde215d0eda51553c0014492fa6d8f23130a922d693782b037625","observation_id":"6550940c-3de2-4731-baa7-c75d2de1b457","resolution":{"observed_at":"2026-08-02T07:53:37.600551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:37.703610Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.703610Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:43954e0aa05e0fc27fa5f7fadb44d6aede6fcd74e4760a347ef33948e03b266e","observation_id":"213a5310-37e9-4a4e-8dfe-ace2187eca81","resolution":{"observed_at":"2026-08-02T07:53:37.703610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:37.774009Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.774009Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:14cabfb8eebc9e2992705737ed1b252fea23ffe5bf3d09490e858d106b542025","observation_id":"c3544f1b-a169-4bf6-bf36-0b2eddcd995a","resolution":{"observed_at":"2026-08-02T07:53:37.774009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-02T07:53:37.845066Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation.arXiv preprint arXiv:2508.05635, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.845066Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:a582ae8e939b0587354309e97a4d2fe19aa855d4278b2cf667c4255c19c3e078","observation_id":"7157e131-888b-40db-80e5-1266bbd3d160","resolution":{"observed_at":"2026-08-02T07:53:37.845066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:37.953851Z","title":"Zero-wam: In-context world modeling for zero-shot task generalization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:37.953851Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b3e3444af0ab59d6f3e26fa24da86e6f9b4206cdcfb9717e34d8711d46d1d587","observation_id":"989faa58-9c6e-4867-b430-1024be949b9d","resolution":{"observed_at":"2026-08-02T07:53:37.953851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:38.034197Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.034197Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:220f689241d2f7fe586ceca198fe4f5d575f3e8ea2bf624179bc4621a20f59e3","observation_id":"70d988ae-88d0-4c34-b461-6f8c0527ef4c","resolution":{"observed_at":"2026-08-02T07:53:38.034197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:38.149544Z","title":"Efficient robotic policy learning via latent space backward planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.149544Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1fde8766f046e07a323290ff90b41073d4be6eb7d3a4445d28e64b3ffe447e3e","observation_id":"9d0f956f-6e18-4743-857a-b1275f1c237c","resolution":{"observed_at":"2026-08-02T07:53:38.149544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-02T07:53:38.340680Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model.arXiv preprint arXiv:2503.10631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.340680Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:39157e2aa40f2e4ac43bd91dfc3829f027dafac587f2b120bc3e8ae27cdf7b6c","observation_id":"42e57d54-56ca-4ae5-8241-ddf09ec27bc3","resolution":{"observed_at":"2026-08-02T07:53:38.340680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-02T07:53:38.463939Z","title":"Muon is scalable for LLM training.arXiv preprint arXiv:2502.16982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.463939Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:d1a112c04a40872251a3173068fdb4729a74f100b1cfb4075cef106ab099bab7","observation_id":"d0b91c59-d9fc-401a-b559-bf219fad0eac","resolution":{"observed_at":"2026-08-02T07:53:38.463939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:38.609411Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.609411Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:3e3280f4a47ab63c09ff13569e781376b8709b166960c4dc95caac4bd4bf9b16","observation_id":"80357a37-92ed-404c-9954-b500f57a5e60","resolution":{"observed_at":"2026-08-02T07:53:38.609411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T07:53:38.754872Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.754872Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1d385370116c23c4e5d2bc6f0bce34946196adb70ea68120930f0cec33172b60","observation_id":"f742ffaf-db65-4417-84e8-dc83c1b193ce","resolution":{"observed_at":"2026-08-02T07:53:38.754872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00078","snapshot_observed_at":"2026-08-02T07:53:38.870441Z","title":"Being-h0.7: A latent world-action model from egocentric videos.arXiv preprint arXiv:2605.00078, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.870441Z"},"links":{"cited_paper":"/paper/2605.00078","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:e773894ee922a55ce5b335c2e0f361828d050a54da401f23f8683b2a9a9bc7d3","observation_id":"31e1959f-f8f6-4323-b3f4-67cbba79ad08","resolution":{"observed_at":"2026-08-02T07:53:38.870441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:39.007360Z","title":"Deep learning for universal linear embeddings of nonlinear dynamics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.007360Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b5a7d7f97f57bff05720dabc98a34411a82a050bb4eb30472aaabe3f8ff08a25","observation_id":"016127eb-9c9c-4361-9303-2beffbf4ce19","resolution":{"observed_at":"2026-08-02T07:53:39.007360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-02T07:53:39.114561Z","title":"F1: A vision-language-action model bridging understanding and generation to actions.arXiv preprint arXiv:2509.06951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.114561Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:cf4e005264733b469906fd3994a063328a8c7d103e42787d202a4ae4e6ed09d8","observation_id":"82731db9-f58d-4d75-abb7-ea7391f4bdd7","resolution":{"observed_at":"2026-08-02T07:53:39.114561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-15T02:36:31.464639Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-02T07:53:39.262642Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence.arXiv preprint arXiv:2607.07675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.262642Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:099cf6280dbd4652f16fe048119b4778aa07bc0a7422ecc0f7ec46f3d6ba2b8e","observation_id":"a760df59-1c6b-4b7a-b322-088f2b59a3c9","resolution":{"observed_at":"2026-08-02T07:53:39.262642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T07:53:39.357615Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.357615Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f079ec9c1af3db344eed659b3401d5637a789c1201cc3be81bd6cf8011c7b018","observation_id":"7f7965a7-7177-4bf5-86d3-14e3cfc22207","resolution":{"observed_at":"2026-08-02T07:53:39.357615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:39.613696Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.613696Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:c0257268240a8f37b543b1807ae1d0ce368b395a06243da2b68b542481d14f55","observation_id":"db996ed5-1aae-4989-a311-ac1f516cfd3b","resolution":{"observed_at":"2026-08-02T07:53:39.613696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:39.782758Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.782758Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:db0b0459cd3ed6a17fa156b18d5018890e35023c3c4f1830df0b9357cb5122e9","observation_id":"df05b6f2-a795-4cc9-84fc-fc67e77e1147","resolution":{"observed_at":"2026-08-02T07:53:39.782758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:39.940731Z","title":"Video generation models as world simulators.OpenAI Technical Report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.940731Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:3c0e38233d5ae286744acc5c556fd51b731d8a0db1ceaa2a4da16db01657c7e7","observation_id":"a57a7258-0d4c-4acc-809d-7563ea038bfd","resolution":{"observed_at":"2026-08-02T07:53:39.940731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.075561Z","title":"Genie 2: A large-scale foundation world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.075561Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:cc3c2a111b0704517273531b6d3f8cf21a85f41605d348905c07cbdcdc314d41","observation_id":"3b474e31-cf5c-4a69-9e3c-6971a874a2d4","resolution":{"observed_at":"2026-08-02T07:53:40.075561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-02T07:53:40.223709Z","title":"π0.7: a steerable generalist robotic foundation model with emergent capabilities.arXiv preprint arXiv:2604.15483, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.223709Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:44aec9e7468a07c752094946b8c7ab7f098f92b80cb1b040b1473a61b50f8243","observation_id":"620f651e-dbd9-44f5-904a-03fc0f8512ea","resolution":{"observed_at":"2026-08-02T07:53:40.223709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.273393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.273393Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:bc138285aca39f7e7776e13380ad583268562d2d88364865781f2192c0106121","observation_id":"067d523a-a812-44f4-9827-541fb04706b0","resolution":{"observed_at":"2026-08-02T07:53:40.273393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.361416Z","title":"Mv-umi: A scalable multi-view interface for cross-embodiment learning.arXiv preprint arXiv:2509.18757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.361416Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:70b58c3b53dbd1fffca36f41b00eaf3a54985d49f018ae19946e04978705ed0c","observation_id":"8239e981-044c-45e4-b994-364b48dccf44","resolution":{"observed_at":"2026-08-02T07:53:40.361416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-08-02T07:53:40.455544Z","title":"Advancing open-source world models.arXiv preprint arXiv:2601.20540, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.455544Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1096aaf59d7d5de27d79c8e74ed834cb652d64c1c22cada76cc1574d802957e2","observation_id":"51c7d500-7bf0-4d62-b789-b5fab20716c3","resolution":{"observed_at":"2026-08-02T07:53:40.455544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.536693Z","title":"Learning to act without actions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.536693Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:00200dafc8b6382de88e1434a88cc415297fba8a1dbd5c8664c6e6932ad152bd","observation_id":"bbd73e22-516e-466e-8214-5e87c11c6397","resolution":{"observed_at":"2026-08-02T07:53:40.536693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.616470Z","title":"Action-conditional implicit visual dynamics for deformable object manipulation.The International Journal of Robotics Research, 43(4):437–455, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.616470Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:cf2594a181f47e89b6ea14b322b69a7a67e4aeaf8c63225095f9bc2f8737120c","observation_id":"81493de0-104e-4a03-94b3-386f92f95158","resolution":{"observed_at":"2026-08-02T07:53:40.616470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-02T07:53:40.697488Z","title":"Memoryvla: Perceptual-cognitive memory in vision-language-action models for robotic manipulation.arXiv preprint arXiv:2508.19236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.697488Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:189781d8b4913b9595d4deecce077600ae43957d2b536ea2b832b0f836d9fd70","observation_id":"8dd98248-6ba5-47c1-a330-e251b58143f3","resolution":{"observed_at":"2026-08-02T07:53:40.697488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.781791Z","title":"Robocraft: Learning to see, simulate, and shape elasto-plastic objects in 3d with graph networks.The International Journal of Robotics Research, 43(4):533–549, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.781791Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:4bc19ca8e15d03a628bc2b70e359337e544f07f36fda16bc5f446a0de24ce4cc","observation_id":"5050c9b9-fbab-4fe4-a951-5af4a2183d50","resolution":{"observed_at":"2026-08-02T07:53:40.781791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T07:53:40.859548Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.859548Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:0435eba0f9f62e41a3e42d7b97652885e692df72e6a2037b42cb7e2cfe123a07","observation_id":"7743bd04-6843-40a3-9be4-6d6e366a7489","resolution":{"observed_at":"2026-08-02T07:53:40.859548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:40.958158Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.958158Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:f6787e08b3e7348d021a7304bcfde13bb771d3aadcfeaf89e014b867074968ce","observation_id":"dc66e10a-b886-4ec7-800f-8a1b7940c302","resolution":{"observed_at":"2026-08-02T07:53:40.958158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:41.099524Z","title":"Memer: Scaling up memory for robot control via experience retrieval.arXiv preprint arXiv:2510.20328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.099524Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:d352960b85e104a97d0531d06ce2e3b2005a4cc011d9dbf393b2cbf46b59cc57","observation_id":"83a27aaa-6b36-4ba9-9c6c-000e835946ed","resolution":{"observed_at":"2026-08-02T07:53:41.099524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12460","last_updated":"2026-05-12T17:47:41Z","snapshot_observed_at":"2026-08-15T07:07:15.758036Z","submitted_at":"2026-05-12T17:47:41Z","title":"Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12460","snapshot_observed_at":"2026-08-02T07:53:41.215461Z","title":"Multi-stream llms: Unblocking language models with parallel streams of thoughts, inputs and outputs.arXiv preprint arXiv:2605.12460, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.215461Z"},"links":{"cited_paper":"/paper/2605.12460","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:fa54e1db7f82c676a32d5b63b87e6a3fcad16f76d426c00737eb3db47bffde8f","observation_id":"d9b72329-d27c-4458-bc99-b92b35339719","resolution":{"observed_at":"2026-08-02T07:53:41.215461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:41.358203Z","title":"Application of a particle-in-cell method to solid mechanics.Computer physics communications, 87(1-2):236–252, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.358203Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:cde5ccd17f5f9018fdb61d1b822b7ac434ad2e74a11badab60874b0eddcda19d","observation_id":"5e5fb8d2-8c54-482b-b4e8-a7a0de2aaa46","resolution":{"observed_at":"2026-08-02T07:53:41.358203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:41.485457Z","title":"Evaluating gemini robotics policies in a veo world simulator.arXiv preprint arXiv:2512.10675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.485457Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b974257b3d7cf48f18fa7b28f4752592ffccb2d1ffde5ee452ef639a54756f8c","observation_id":"ee6b3130-daee-486f-8e24-78cc2faf161c","resolution":{"observed_at":"2026-08-02T07:53:41.485457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:41.677791Z","title":"Causal video models are data-efficient robot policy learners.Rhoda AI Blog, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.677791Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:456922e640afb4ee50705e48139f4799c2b3cd1a72a45f4e893e3743617bc31c","observation_id":"8ddefbd4-669a-4e69-97ff-ebd79ff697a2","resolution":{"observed_at":"2026-08-02T07:53:41.677791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:41.823564Z","title":"Gemini 3.1 pro: A smarter model for your most complex tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.823564Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:5f1bf9713a88805ea87832a6f19b55d676dae1f54b3c8c89638dae55a6aeac21","observation_id":"26cdb36a-6763-4cef-a2ae-90a695e11eba","resolution":{"observed_at":"2026-08-02T07:53:41.823564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:41.975646Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:41.975646Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:09f741e94609162329328aaf81381597e45166648d98d913f2cb98533b03e69b","observation_id":"58245a4f-cd90-404d-87ad-35e7a1ab0f69","resolution":{"observed_at":"2026-08-02T07:53:41.975646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:42.073860Z","title":"Interndata-a1: Pioneering high-fidelity synthetic data for pre-training generalist policy.arXiv preprint arXiv:2511.16651, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.073860Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:dc2534b7074d0e5dd62572be6d8ecb41fc92972f9bd82cc4cd24524315ccf632","observation_id":"6d550953-393d-4d40-8911-971133e44638","resolution":{"observed_at":"2026-08-02T07:53:42.073860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:42.262525Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.262525Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:22ebae40709c18a7aeb33e7ed36f8948a0a05a8c16368986cb04c74ba3f8d582","observation_id":"faf7bff2-7eaa-46d0-9391-627f988a76c7","resolution":{"observed_at":"2026-08-02T07:53:42.262525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:42.444882Z","title":"Wan-2.6.https://wan.video/introduction/wan2.6, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.444882Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:cfbfc9a0d0986cfedcc9d5d4d931abee5e76819e53550ab6e1d53f190de8a0cd","observation_id":"37b92bd0-663f-4b0c-b5de-319d721355a6","resolution":{"observed_at":"2026-08-02T07:53:42.444882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T07:53:42.538533Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.538533Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b9c9dcc724473f762ff230e456dae2cf4566c15ec4ae28bae468b73bfc94b6d2","observation_id":"f62ed543-6f13-49fa-a962-7001878f9cb1","resolution":{"observed_at":"2026-08-02T07:53:42.538533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:42.695660Z","title":"Mimicplay: Long-horizon imitation learning by watching human play","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.695660Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:c37364b188fbab19f5ae4ed7ddd41e6da25f6fb93773a8d62999018aa582f549","observation_id":"0db74f32-95e0-4f38-a473-5cc412fd5aaf","resolution":{"observed_at":"2026-08-02T07:53:42.695660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:53:42.855514Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.855514Z"},"links":{"citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:ee98fef438ec436be65783bf181a8c16c29e5fb8057ae47dab2e7430140cfb82","observation_id":"aad1b8e6-edd7-483e-8485-9b6d7919d4f3","resolution":{"observed_at":"2026-08-02T07:53:42.855514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-13T22:58:06.874802Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13674","snapshot_observed_at":"2026-08-02T07:53:42.995964Z","title":"Repwam: World action modeling with representation visual-action tokenizers.arXiv preprint arXiv:2606.13674, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:42.995964Z"},"links":{"cited_paper":"/paper/2606.13674","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:c0d1952fd16805a421e80dd93bb9f743d796573d388ac34612a3489c41af35d8","observation_id":"c6f6253c-93ed-4fcc-a289-8e2b50587317","resolution":{"observed_at":"2026-08-02T07:53:42.995964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-15T04:59:51.918109Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-02T07:53:43.109347Z","title":"Auxiliary-loss-free load balancing strategy for mixture- of-experts.arXiv preprint arXiv:2408.15664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:43.109347Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:7da2d6a361d8e661724fd0f45cb346d366e7d42a0e4ab6571134a45a9e4cfd4a","observation_id":"3f495a8d-c245-4a17-b45c-985ac738d9c0","resolution":{"observed_at":"2026-08-02T07:53:43.109347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":134},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 134 outbound references and 8 inbound Pith citation observations for arXiv:2607.08639."}