{"as_of":"2026-08-20T13:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:462736500187498312597f6ef2ce44435856a2e33ff6da3e5cc0e274feafe789","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T22:22:57.548803Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24159/citation-record","integrity":"/paper/2607.24159/integrity","json":"/paper/2607.24159/citation-record.json","paper":"/paper/2607.24159"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.255033Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.255033Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:fc8f476bf0aafa8bf6ca4884e4feaecd2592c6e7fed166077378fc9df032936f","observation_id":"19905a6f-3b92-47ef-affc-bcd8cffe86cc","resolution":{"observed_at":"2026-07-31T22:22:57.255033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-31T22:22:57.260241Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.260241Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:b03a0969ad74a54338715d430827534ed4f4d216c0b1b48609ef025add1fd179","observation_id":"e1745378-4361-43e3-91c9-68d2fb4b2a50","resolution":{"observed_at":"2026-07-31T22:22:57.260241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-31T22:22:57.265413Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.265413Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:923baddac15c2162d0181818c73ac3c9a47418254a164cfb76672539b02cd70d","observation_id":"53b4ae8e-825b-4b23-ac85-fd0ec7768885","resolution":{"observed_at":"2026-07-31T22:22:57.265413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.269896Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.269896Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:30decceb586499eefc1b960a4783da7ac778c9e7c7ed2dbf6ad1b91cf7bc57a7","observation_id":"b277f331-a6d7-4e6c-954b-1859521f5ab1","resolution":{"observed_at":"2026-07-31T22:22:57.269896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.274255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.274255Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:b2754c8936ba3596c0333e6fa32a20ff3f376f3dee49e1012ed3621632804faf","observation_id":"b88f3f34-c885-46af-adef-82260df20159","resolution":{"observed_at":"2026-07-31T22:22:57.274255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.278493Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.278493Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:c0b90ef255b3a24a3dc484ce960486f1cc4aa5c048979d6bfa54289678fbe82f","observation_id":"4eac0d10-4939-456e-9377-cd829b678235","resolution":{"observed_at":"2026-07-31T22:22:57.278493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.283118Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.283118Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:72c9d220851b29cb52dd07edc8fe588e536d4179fc5efb7e1ed93e711d6713fe","observation_id":"df4d6091-43e8-4eee-97a0-c6a23e80c5f2","resolution":{"observed_at":"2026-07-31T22:22:57.283118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.291517Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.291517Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:43abfe302e9992f99bca7e5fa79ede38c5019d0bcf2efb8a4919627552bb001d","observation_id":"5474c680-7dc1-4bf8-8858-baa522f260da","resolution":{"observed_at":"2026-07-31T22:22:57.291517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-31T22:22:57.295734Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.295734Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:17934d681660ee4876248fb175fd32fdad2d14c65a3c4da86989e30e2186f480","observation_id":"6389f3fc-e298-49ef-bd8c-53db376d7cbb","resolution":{"observed_at":"2026-07-31T22:22:57.295734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.300560Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.300560Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:f5cc0fa6fa0ad7684b176cb69c8b734ac2dba5772ffc5c08cf674c71f582b8d1","observation_id":"d0df16b3-2bf5-4545-a0f3-bcf7940a3531","resolution":{"observed_at":"2026-07-31T22:22:57.300560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.304517Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.304517Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:2d62baaaf945efa92b744956291bada6c5c5aa3cee8c476f311be5c005d51c9d","observation_id":"d78669f3-2ebe-4f8a-97fb-cddb76031a8a","resolution":{"observed_at":"2026-07-31T22:22:57.304517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.308480Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.308480Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:183dcb96907709d556f2beaeb793a7851affd3ac959dfd9ceed13cdd3d3135a2","observation_id":"98c850ca-ba44-46ed-b8b0-1e790ba5397b","resolution":{"observed_at":"2026-07-31T22:22:57.308480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.312279Z","title":"Nasiriany, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.312279Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:4e80e68667c4f0839a26aa3b19a21029dc221b3de1193cf4ade72f545f98e10b","observation_id":"2a8d5f41-6896-4abb-95c9-96587c05ab23","resolution":{"observed_at":"2026-07-31T22:22:57.312279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.316250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.316250Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:eb1aa09836d3da662f8039a5aabac1c98af985b3134eb4df3ac6c187d5bcd559","observation_id":"a7824335-843c-411d-b344-a93a16990e0e","resolution":{"observed_at":"2026-07-31T22:22:57.316250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-31T22:22:57.320069Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.320069Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:27b82830b38f9f7ad5e2ded59a912868cdb870a1fce5a41a80b5be579c7e873a","observation_id":"5a81f423-0224-4ec3-a6b9-0f258a265a52","resolution":{"observed_at":"2026-07-31T22:22:57.320069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-31T22:22:57.324128Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.324128Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:eb065e0e11f7919107262d6cd25d333cbf1dbf6efb9de5e28fd4aa97fc49e7fa","observation_id":"7243f98a-f069-43ae-8424-96ea78b98438","resolution":{"observed_at":"2026-07-31T22:22:57.324128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.328256Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.328256Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:41910873fe977f7e41a6817a56eb7f53b015bbebcae103ae24635a5ab3575531","observation_id":"633226d6-deb5-4c25-ae45-40663145f400","resolution":{"observed_at":"2026-07-31T22:22:57.328256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-08-17T17:11:08.085240Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-07-31T22:22:57.332258Z","title":"Bousmalis, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.332258Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:4571e9a3732098393b8cef4f793e572f43a7fa972463b76da006da1a6bbcbd58","observation_id":"9f833dbe-40e6-4fa2-b5a9-704d0d7e45a2","resolution":{"observed_at":"2026-07-31T22:22:57.332258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.336352Z","title":"Ghosh, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.336352Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:379bdfa32ea591cf4187e170311d703bd28d466b987f2343d522f30c89e6f1a8","observation_id":"ef38c8e5-ebe8-460b-b926-62cee53f0037","resolution":{"observed_at":"2026-07-31T22:22:57.336352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-07-31T22:22:57.340203Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.340203Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:f02b2965ee0010c60b0c74d389ead9af70edfc7b171ba8f76d8b2d71ef949f08","observation_id":"1399733a-c1bb-4b42-bde8-d7b748a58cc4","resolution":{"observed_at":"2026-07-31T22:22:57.340203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.344304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.344304Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:7f782b8141176d7a89289143af38435fb389fd1afe90bfa5014aba34de0f4f98","observation_id":"f4448fa0-6e2c-47fa-a1a9-6abc471673d8","resolution":{"observed_at":"2026-07-31T22:22:57.344304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-31T22:22:57.348283Z","title":"Bjorck, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.348283Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:5656a11f65c8e1af66eb02b76737c274763f2355f67a9b358c8d109eb884f243","observation_id":"588fcd90-e1e2-43fa-ab99-97107b1bfd86","resolution":{"observed_at":"2026-07-31T22:22:57.348283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-31T22:22:57.352807Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.352807Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:2dbf7555df90055222a1b6fb60ca961856d74d5a61ac1137e58bf75835d8666d","observation_id":"0fcdb6dd-5691-473a-9a45-1a7b091a31db","resolution":{"observed_at":"2026-07-31T22:22:57.352807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-31T22:22:57.357125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.357125Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:36427a99340d3bb696828fd56abaaf4dfacb6b80bdc7b098f787b8b767e42805","observation_id":"4a66b1c1-d881-4037-acfa-dbc2cb119a32","resolution":{"observed_at":"2026-07-31T22:22:57.357125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.361657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.361657Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:344983da58c9c9e07d80e00cc1c277f1b857ea15cfcf766e71ea1edf3e110df6","observation_id":"0801e5b1-3174-4630-b5d4-3057f393b0b0","resolution":{"observed_at":"2026-07-31T22:22:57.361657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-20T05:57:34.826209Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-31T22:22:57.366200Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.366200Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:7b7656284efd91044da7872c71563a071894be7a7838afa424788774b1a408e4","observation_id":"8f800335-db9e-4c97-8b08-cdc141274db6","resolution":{"observed_at":"2026-07-31T22:22:57.366200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.370636Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.370636Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:2063516f6c1a8e932fb6ca67d80a6870047e3b93861efb494f4acbfd87b00029","observation_id":"e0e3446d-8b11-42e4-bcbd-ebd170568de5","resolution":{"observed_at":"2026-07-31T22:22:57.370636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-31T22:22:57.374891Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.374891Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:02536d3f9ea841cfc99d982c5e0e3cbb41cce3f668384fec0036da290dfb86b1","observation_id":"7a00f9fc-f017-4086-9a94-47f5c2020697","resolution":{"observed_at":"2026-07-31T22:22:57.374891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.379570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.379570Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:9294b70eb3acafa7f76cbb0c578c34acabe6e39c3f1a7d040aba5f9f54e97ba7","observation_id":"a845fd54-a82e-4881-8fd5-d6d52e2ff2da","resolution":{"observed_at":"2026-07-31T22:22:57.379570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.384048Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.384048Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:5d7778280c9f2c6cc239ac196209535c3848b8fa3c136fdc7760097a09e7753d","observation_id":"02914efe-a88f-42d4-ba51-d7f0b8998f16","resolution":{"observed_at":"2026-07-31T22:22:57.384048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.388405Z","title":"Black, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.388405Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:cc19f30e2393aa9f669cea18e39adff4b3281f921642de263ffd45feb77d8289","observation_id":"17dbc0b7-e973-41ef-be13-433f19a2eaa2","resolution":{"observed_at":"2026-07-31T22:22:57.388405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.392782Z","title":"Bharadhwaj, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.392782Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:30ede6452d90f4a795a3c67693995efc00cfefd07a3ee769d0009e24a03ca38d","observation_id":"baa7a1d3-52b2-4983-8aab-618e9a8b806e","resolution":{"observed_at":"2026-07-31T22:22:57.392782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.397127Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.397127Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:57f55dc957ed2db3c033556aa5cb237f925c67bccc05c3098c95eb521b2502d5","observation_id":"7eaa1a41-0284-4dbc-a583-01b40d635468","resolution":{"observed_at":"2026-07-31T22:22:57.397127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.401759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.401759Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:17b4bbdf4a00e0d983fdf704d63e4eeadb2dc5e8c246bd94ce8d26904505a370","observation_id":"a7997230-bfd9-4e09-981c-61e92a35eadc","resolution":{"observed_at":"2026-07-31T22:22:57.401759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.405956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.405956Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:2943cb763872fce149299844bb816eef01a0a331a58a660d1e1ac08c7907ae01","observation_id":"9ddee1b6-3280-4dab-ad1b-ad10abc47413","resolution":{"observed_at":"2026-07-31T22:22:57.405956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.410151Z","title":"Zheng, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.410151Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:cfe14a9dacafac93c07a1b96abeace0e2dd0c6d2774cd04586284e37ab8349d7","observation_id":"86f5ab5d-219d-4a63-8eb0-82c73a3b0a75","resolution":{"observed_at":"2026-07-31T22:22:57.410151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-07-31T22:22:57.414278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.414278Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:d6139fc83093cd9721d4d9d2159c9d8121ae5184e6e4468611a00f63894d9e5a","observation_id":"cc1c9fde-8643-49fb-8c98-56866c8d6a45","resolution":{"observed_at":"2026-07-31T22:22:57.414278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-07-31T22:22:57.419075Z","title":"Liang, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.419075Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:59e42e611a70fa90496cc49560a17d1660bdca22986ad6171c214a267543ebf8","observation_id":"978c061c-21bc-4a07-b3b6-4d9f05373494","resolution":{"observed_at":"2026-07-31T22:22:57.419075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.423426Z","title":"Routray, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.423426Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:ddedb63a2067f7dd9d2c7be56b360d19adbd03963efc20572264e142c6f68a5b","observation_id":"f63d5ccf-6d81-402a-bdf0-88b708db64a4","resolution":{"observed_at":"2026-07-31T22:22:57.423426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-20T03:53:25.888886Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-31T22:22:57.427451Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.427451Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:df82957d731eca3738a3ae6453b357a88ee0f7a5c9c7cd7e1d03a171ddcafc35","observation_id":"83cd82a7-2bf3-4dce-b272-19feeddd637f","resolution":{"observed_at":"2026-07-31T22:22:57.427451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.431831Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.431831Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:4283af218de492dfd80670449016847d5ddab0d7778e906032baf87d2e88f36b","observation_id":"960ff7de-616f-4fe0-ae66-f38f9a5df62a","resolution":{"observed_at":"2026-07-31T22:22:57.431831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.436208Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.436208Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:6b3f7745cefa1d78043bc462422f5947648f5cc6201de8be026778464bc038ae","observation_id":"f07de559-f058-4414-956c-d9524a0ae6b9","resolution":{"observed_at":"2026-07-31T22:22:57.436208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.440217Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.440217Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:fe0940e324111d10a94c0c7e91d96b64192b6f8384a8ed1cc412c47365433da6","observation_id":"8f158553-a421-4457-9df0-531abc24eda1","resolution":{"observed_at":"2026-07-31T22:22:57.440217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.444092Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.444092Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:ca7a7c7d7478129d66688968f01971c36fde2f9701879e887fd1454eed10c7fb","observation_id":"f1cacec2-7a92-4b21-9be3-4ac67325f8c8","resolution":{"observed_at":"2026-07-31T22:22:57.444092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.448186Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.448186Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:736eef3d0b56abcfac868bd130c706803921d08fec01f3aa2f4e86be590dde1e","observation_id":"a16b6489-09aa-45c9-89f5-62d4fa889a88","resolution":{"observed_at":"2026-07-31T22:22:57.448186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.451857Z","title":"Huang, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.451857Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:5897eb5a435aa1d30cb47f189d727b04e3986d109b905e8a9c16c336f3482949","observation_id":"279ab5b8-1888-4ad0-9ed3-1127dbe367ef","resolution":{"observed_at":"2026-07-31T22:22:57.451857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.455547Z","title":"Nasiriany, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.455547Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:78426c75b761145cd858e9de10b1d4798dadcfe379d947b92860bd78f27e9d1e","observation_id":"4179a6fa-97e1-4f0b-8a2b-93e2d7583545","resolution":{"observed_at":"2026-07-31T22:22:57.455547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.459301Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.459301Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:b0e631160c20363b02a6d2c5e23c9121bc9ea0af2f82c32d2acb9df7af221425","observation_id":"eb8891b6-c094-467c-81d9-bb7ecb6a41d0","resolution":{"observed_at":"2026-07-31T22:22:57.459301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.463084Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.463084Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:6a8e2a14df2196eb08ed52a34df616ac0678e346d2c04c51d42c48ce8fcbc376","observation_id":"639c6abf-92a0-40c5-af88-e4d60532426c","resolution":{"observed_at":"2026-07-31T22:22:57.463084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.467155Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.467155Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:d102a2483f9c50352ee038c7480c36c54c5b06d375be74141f3ae735ad8a5e2e","observation_id":"56e1df26-a186-420b-a666-8bc27c3c1fdc","resolution":{"observed_at":"2026-07-31T22:22:57.467155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.471021Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.471021Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:38babc51537bba0223b1def0355dca2afb3a477e68e8d21388a3db62956ae190","observation_id":"0a751333-1ebf-4a45-b77e-7f0dc9281bcb","resolution":{"observed_at":"2026-07-31T22:22:57.471021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.474966Z","title":"Goyal, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.474966Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:bf817895b4974c4cba3e531d20d76eb62b7878eb42bfe984fe774ea74ec834a5","observation_id":"2ceae4cc-e62c-42d1-86be-8b82f8a0f0cc","resolution":{"observed_at":"2026-07-31T22:22:57.474966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.479043Z","title":"Gervet, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.479043Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:feaa9e129f93e64b642788b970495cdeb9c40386ef91e3eb01dbc51c3316ca20","observation_id":"9f1b8c65-bde9-4559-a6cc-b0fdfa2523e0","resolution":{"observed_at":"2026-07-31T22:22:57.479043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.483120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.483120Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:3e7ec7876fa94eb3e71cb683c61a8aec7a26ac67caceb4b36223c36e00c83f48","observation_id":"4502dd49-ba40-4c7f-b66d-73b596974189","resolution":{"observed_at":"2026-07-31T22:22:57.483120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18623","last_updated":"2024-12-14T18:38:03Z","snapshot_observed_at":"2026-08-17T15:33:20.353144Z","submitted_at":"2024-11-27T18:59:52Z","title":"Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18623","snapshot_observed_at":"2026-07-31T22:22:57.487284Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.487284Z"},"links":{"cited_paper":"/paper/2411.18623","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:675c73ea0542be0e49187ae01c2886c16b2ce068b83adbaa298765fcf2d2e9df","observation_id":"6c60db58-34b1-4852-a347-e04e46c2f268","resolution":{"observed_at":"2026-07-31T22:22:57.487284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.491536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.491536Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:f444bb72750f0f6105f996da46d869d5a06f5560be950b76b7b46c8d746317f6","observation_id":"43a1f019-b46c-43db-8916-afc6f27e030f","resolution":{"observed_at":"2026-07-31T22:22:57.491536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.495429Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.495429Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:f1e61b0e61a9ff714078d35e328692e8d8f12efa5bcaecf3c214d446548ff740","observation_id":"c90b5ce7-4706-4564-b6be-ca96263a331b","resolution":{"observed_at":"2026-07-31T22:22:57.495429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.499667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.499667Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:4f9eca581c0960756fbac7cd002259957a63df06ae086ffae813970b59402e18","observation_id":"5861484f-b0b4-4705-9c77-5448ac1e9d94","resolution":{"observed_at":"2026-07-31T22:22:57.499667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11135","last_updated":"2026-04-13T07:48:58Z","snapshot_observed_at":"2026-08-16T01:26:32.469538Z","submitted_at":"2026-04-13T07:48:58Z","title":"AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11135","snapshot_observed_at":"2026-07-31T22:22:57.503475Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.503475Z"},"links":{"cited_paper":"/paper/2604.11135","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:38cfae67b8ae826f1b092688f488f1f4b11e0d4a542bf603e7fc3ef13514d0a0","observation_id":"3ddc113c-e9fd-46b4-be6f-11480ea2a1b2","resolution":{"observed_at":"2026-07-31T22:22:57.503475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.507595Z","title":"Cosmos-predict2: World simulation model for physical ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.507595Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:208fec87ccf10943fb2992f2d2019f3d6e23e8edd4346bfce52b1abf1f0112f1","observation_id":"8de8626c-220c-4dba-be4a-9e509b439493","resolution":{"observed_at":"2026-07-31T22:22:57.507595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15549","last_updated":"2024-10-21T00:36:02Z","snapshot_observed_at":"2026-08-19T23:50:57.934159Z","submitted_at":"2024-10-21T00:36:02Z","title":"A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15549","snapshot_observed_at":"2026-07-31T22:22:57.511531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.511531Z"},"links":{"cited_paper":"/paper/2410.15549","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:044e755251e935cc999dc3689f468eeabf2c8c5ccbe090badffaa0c425280fae","observation_id":"9de95d24-ab07-4f68-af83-7bafbcf34aa2","resolution":{"observed_at":"2026-07-31T22:22:57.511531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-20T12:48:43.629709Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-31T22:22:57.515817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.515817Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:c23cd01b496da1a83fb100e729f8a51c4ac2ccac88c7b142b4e708b480334630","observation_id":"6eecc954-fad2-4ecf-b563-8cbb4475a9dc","resolution":{"observed_at":"2026-07-31T22:22:57.515817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00695","last_updated":"2026-04-15T17:01:03Z","snapshot_observed_at":"2026-08-12T17:36:16.455110Z","submitted_at":"2025-10-01T09:15:52Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00695","snapshot_observed_at":"2026-07-31T22:22:57.520340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.520340Z"},"links":{"cited_paper":"/paper/2510.00695","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:c1243c82a09deb742d537a4119863196641794a3831f5bda6c3ffe96cdd0e244","observation_id":"b584baf6-6a81-431e-a95a-a20dbce31965","resolution":{"observed_at":"2026-07-31T22:22:57.520340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.524442Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.524442Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:712c39d4a62571d16d77be6785053ae43e97dea5fc185a156ed51aa732ce5c07","observation_id":"0a2acb9e-12f3-4c15-b5a9-9548d31f3e65","resolution":{"observed_at":"2026-07-31T22:22:57.524442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-07-31T22:22:57.528334Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.528334Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:89d941042412cede7a0831ccead8246a3b724f0fa5777bc312f2c7831606c0b3","observation_id":"99e69238-6f7c-4928-8ed3-f563dfb16684","resolution":{"observed_at":"2026-07-31T22:22:57.528334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-07-31T22:22:57.532718Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.532718Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:6559effd3e0822bcc4cc203cf40d30f1d46be6cb4a70ce668ffc6397cf824700","observation_id":"5bfa3065-55d4-4748-92b0-e6879300534f","resolution":{"observed_at":"2026-07-31T22:22:57.532718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-08-17T15:25:05.328906Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-31T22:22:57.536880Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.536880Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:2507864458a10247cd9c07cee9ea3bae9a29d74184563462fc805506abfe4eb2","observation_id":"c5f902e2-2545-4f6d-b9eb-168141214305","resolution":{"observed_at":"2026-07-31T22:22:57.536880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.540996Z","title":"Y AM Arm Series.https://doc.i2rt.com/products/yam, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.540996Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:63605fb9b724e8b60b18793f193edee524e95a69dc454a8403b3d2437fbd492e","observation_id":"2b526783-7599-4ed0-ab38-89c48e99f54a","resolution":{"observed_at":"2026-07-31T22:22:57.540996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.544862Z","title":"Cheng, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.544862Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:6fc4da67b7a4fafe79d393c55ce7bc66c93277064168870a6cc8c3969d29ccaf","observation_id":"07b7a600-b9bc-43c1-96c4-c05b068f6305","resolution":{"observed_at":"2026-07-31T22:22:57.544862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:22:57.548803Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.548803Z"},"links":{"citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:356fa76cf9c24bbe49d9dddb77ba9cd6ed77fb3873be773b1ab8b303d46fa786","observation_id":"8c8982dc-072c-4832-a982-0156c1673d57","resolution":{"observed_at":"2026-07-31T22:22:57.548803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-31T22:22:57.287144Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.287144Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:1ec89fded317932edf2597454080575d7ca419866726c8d0fc044766674cbf7c","observation_id":"3a562c08-9534-4121-8374-e50f5cfaae46","resolution":{"observed_at":"2026-07-31T22:22:57.287144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T16:31:13.234013Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2607.24159."}