{"as_of":"2026-08-14T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64f4282696760b833a10c7f72d6101e7fb569e90446f62fd75756518c7b24a02","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T09:42:46.124953Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28362/citation-record","integrity":"/paper/2607.28362/integrity","json":"/paper/2607.28362/citation-record.json","paper":"/paper/2607.28362"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-07-31T09:42:43.174832Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.174832Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:938be3e228749605f192f421cffc4893b91c27e51d327948abb02021be31dc2d","observation_id":"0cc3fdef-8df9-43dd-8036-3494ac4b319b","resolution":{"observed_at":"2026-07-31T09:42:43.174832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.214748Z","title":"Alemi, Ian Fischer, Joshua V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.214748Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:1e90c403c4fa48de57d5bea6909dc134c7c6fa7bfd93f21f3516efc857e9eda8","observation_id":"2daa5e05-2e46-455b-b654-01b37e84aa2d","resolution":{"observed_at":"2026-07-31T09:42:43.214748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.264815Z","title":"Diffusion for world modeling: Visual details matter in atari.NeurIPS,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.264815Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:1906e37ab0047175e1b6a9b5c04e6da18e05b20c49de8962cc29310c751eec89","observation_id":"50c5c747-829f-459e-afaf-d0249fe99f0a","resolution":{"observed_at":"2026-07-31T09:42:43.264815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-07-31T09:42:43.304749Z","title":"V-JEPA 2: Self-supervised video models enable understanding, predic- tion and planning.arXiv preprint arXiv:2506.09985, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.304749Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:1d91e1e2fcd0cb7a4d9d053161ee20c532c51157cda78e5a9635b8024ca7647c","observation_id":"95551ff5-9100-4a3d-a16c-3d6d5f9e35f9","resolution":{"observed_at":"2026-07-31T09:42:43.304749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.344750Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.344750Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:46ab05c9d09901d9379121ff7a3de3003deccbbc89f7eafa057498a6be64eb8b","observation_id":"a07afd64-f1a5-4664-b436-ec2e4df0a870","resolution":{"observed_at":"2026-07-31T09:42:43.344750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.394749Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.394749Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:ac8e5f0b67d3e219aff7d759638de6f3350e78ed93ab7ee23a336712bf9fcb21","observation_id":"895a2a40-c650-4975-9a1d-338dafd4e6f2","resolution":{"observed_at":"2026-07-31T09:42:43.394749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-31T09:42:43.444748Z","title":"UniVLA: Learning to act anywhere with task-centric latent actions.arXiv preprint arXiv:2505.06111, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.444748Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:a13fc4be08c66b5958852a023dd73b4eb488bd6d322fc905c85b6d2c234281a8","observation_id":"921e214d-68bb-4b0a-adfb-80a4aafded6d","resolution":{"observed_at":"2026-07-31T09:42:43.444748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.494747Z","title":"Unifying 9 precisely 3D-enhanced camera and human motion controls for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.494747Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:b1487f6facfafcad2f53a0085a8c49b4e0614e69d498f1cf1855707260ff4f6e","observation_id":"b05301fe-6cf7-4ba0-9881-b3ed840bc7ac","resolution":{"observed_at":"2026-07-31T09:42:43.494747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-31T09:42:43.544741Z","title":"SkyReels-V2: Infinite-length film generative model.arXiv preprint arXiv:2504.13074,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.544741Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:c326acce82a2fbe1c2c3a6375b1f5b388237bb393c5f3e53899869f1f14a6d8a","observation_id":"e79f2140-3608-4fe3-ad27-5b5ce6e30a83","resolution":{"observed_at":"2026-07-31T09:42:43.544741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.584747Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.584747Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:7264c7cd59a2519b47dbd59ae648d75e642fbf845ceb9000deec018dc2b7a021","observation_id":"eebf8b52-c392-45c3-a1ec-e1bd6647f5ad","resolution":{"observed_at":"2026-07-31T09:42:43.584747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-08-12T22:20:58.176075Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-07-31T09:42:43.644737Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI.arXiv preprint arXiv:2411.00785, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.644737Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:83444bf1628062ef641da2e9be7598a36d2bb7176b85c883f58bf305c229af7c","observation_id":"58573bcf-2373-411b-884b-74b3d872dc1c","resolution":{"observed_at":"2026-07-31T09:42:43.644737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-12T05:49:07.187171Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-31T09:42:43.694744Z","title":"villa-X: enhancing latent action modeling in vision-language-action models.arXiv preprint arXiv:2507.23682, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.694744Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:afe1b1634b9ef0eb89843f9df0a3b8fc444dd28a8df82f8fb2129b163e77b9d8","observation_id":"3e21d9a3-bb1e-4302-96d6-294f423697e5","resolution":{"observed_at":"2026-07-31T09:42:43.694744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.744743Z","title":"Moto: Latent motion token as the bridging language for learning robot manipulation from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.744743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:5ad581ba503dbff42849c3e131fe055503ff8b130dc6a87943c2d7a8c644a7f0","observation_id":"d770cff0-6283-41d1-a248-f7da423f6238","resolution":{"observed_at":"2026-07-31T09:42:43.744743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.784743Z","title":"Oasis: A universe in a transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.784743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:d289c673fa7d8a13bc4eb15ed3641e1d3a02d47b4e47efa403ef0a2441e79ea7","observation_id":"78b40ba3-62ac-4488-9554-e59c27660042","resolution":{"observed_at":"2026-07-31T09:42:43.784743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.824747Z","title":"Imitating latent policies from observation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.824747Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:c57ff2157445a95c34bd23fd80b1e69b442f410b3320bbfb678e756760209a57","observation_id":"d0f8044a-cec1-47af-a8c9-f6c2b63d6bb6","resolution":{"observed_at":"2026-07-31T09:42:43.824747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.864743Z","title":"3D-aware implicit motion control for view-adaptive human video gener- ation.arXiv preprint arXiv:2602.03796, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.864743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:083f7e9fc5ce27d55428a47e153920cb40323b020655f3680d85acefa5b52934","observation_id":"b1981785-596a-4c46-a4d9-39b8067b59cc","resolution":{"observed_at":"2026-07-31T09:42:43.864743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.904990Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.904990Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:c1eea9e49786e95d88199c18712380c63a50c11bf5aa4b5d3f253c7302c08fbf","observation_id":"84bb22fc-96aa-479e-863f-8368f939e21b","resolution":{"observed_at":"2026-07-31T09:42:43.904990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:43.944744Z","title":"AdaWorld: Learning adaptable world mod- els with latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.944744Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:06e8917dbf586e425e8ecc745e9ef4ffd085ad355fffd080d174b7fd2289c95e","observation_id":"563af642-dccb-43ed-a031-911bca51205a","resolution":{"observed_at":"2026-07-31T09:42:43.944744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07534","last_updated":"2026-07-08T15:33:25Z","snapshot_observed_at":"2026-08-13T19:49:25.794747Z","submitted_at":"2026-07-08T15:33:25Z","title":"Infinite Worlds with Versatile Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07534","snapshot_observed_at":"2026-07-31T09:42:43.994747Z","title":"Infinite worlds with versatile interactions.arXiv preprint arXiv:2607.07534, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:43.994747Z"},"links":{"cited_paper":"/paper/2607.07534","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:7dc4f05cfedd68a24c50bf9e98b57a8d41228a70ef1068e065157e1eaf28b128","observation_id":"df9059cf-dc7b-4856-95f4-1f355f42e766","resolution":{"observed_at":"2026-07-31T09:42:43.994747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.044742Z","title":"Learning latent action world models in the wild.arXiv preprint arXiv:2601.05230, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.044742Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:760e198b5de6eca05e0fa345ddf931009282b938bd08013c40f481d0d0c2fec6","observation_id":"eb78f706-167e-4ce2-ad41-30d5f8ee1484","resolution":{"observed_at":"2026-07-31T09:42:44.044742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.094743Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.094743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:1fcb887ca731acac60da90386c0931e3f6816787964aa12812d477471315db18","observation_id":"a5feff2b-b79a-4ecb-8b78-8fba41849b57","resolution":{"observed_at":"2026-07-31T09:42:44.094743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.144742Z","title":"Rubenstein, Arash Mehrjou, Francesco Locatello, and Bernhard Sch¨olkopf","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.144742Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:0549e86febd46768bc92caa489de6683e743c86aff2fd49b0d57b48e120370bb","observation_id":"73b1e3b1-4027-4ea0-b37e-265520a250aa","resolution":{"observed_at":"2026-07-31T09:42:44.144742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-07-31T09:42:44.194744Z","title":"Long-context autoregressive video modeling with next-frame prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.194744Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:85735e69b3c16557de172ee90db7e51aa11993f31761b11ee13b78e332b3c7af","observation_id":"2ba72ee7-6be7-4d19-abc6-da8ca5cd8ef6","resolution":{"observed_at":"2026-07-31T09:42:44.194744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-07-31T09:42:44.244743Z","title":"World models.arXiv preprint arXiv:1803.10122, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.244743Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:e6efe9a3db1aeb2ce88bd86f8597c40abd64c36044c8a14cf8e24d804017983b","observation_id":"1ce3ba9a-d81e-4072-851d-a9ef803f328e","resolution":{"observed_at":"2026-07-31T09:42:44.244743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-07-31T09:42:44.294746Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.294746Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:d2b027f4d2ae0ee983f225e38dc0b09784dd09f24fbbe52af62fe1a898e3c32b","observation_id":"72725158-0425-4edf-9740-547d8922ea1a","resolution":{"observed_at":"2026-07-31T09:42:44.294746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-07-31T09:42:44.344741Z","title":"Matrix-Game 2.0: An open-source, real-time, and streaming interactive world model.arXiv preprint arXiv:2508.13009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.344741Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:4a52bacc55d29f6f264b26dc61c6c4dfd2240cc9fea9b6a9813830ecda40bfd7","observation_id":"2c8cbe4a-78dd-4770-a825-e8524144c0fb","resolution":{"observed_at":"2026-07-31T09:42:44.344741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.404741Z","title":"beta-V AE: Learning basic visual con- cepts with a constrained variational framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.404741Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:525870d3175dc7f56b99fd92c1330b2a52ee34595f10a1ad93586b24dacc6b7b","observation_id":"8af2c3d5-f526-4657-859a-2b5e30e2109d","resolution":{"observed_at":"2026-07-31T09:42:44.404741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.464744Z","title":"RELIC: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.464744Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:01ee97c151808b761b8e378ea5c4b999d8e7ade371b9ace5c29a32844bb3f503","observation_id":"3e9efc1c-e99e-4aa8-9743-fe64528007c0","resolution":{"observed_at":"2026-07-31T09:42:44.464744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.505325Z","title":"Approximation capabilities of multilayer feed- forward networks.Neural Networks, 4(2):251–257, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.505325Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:e68b2d9274ab42ae370584dd25d98c96e6816a07e38153db69eaa8ab4464e6d0","observation_id":"6cb12e9f-b891-47a9-9787-622a0e744be5","resolution":{"observed_at":"2026-07-31T09:42:44.505325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-07-31T09:42:44.554745Z","title":"Self forcing: Bridging the train-test gap in autore- gressive video diffusion.arXiv preprint arXiv:2506.08009,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.554745Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:832c077b7791bfa1390f9b5a5ad51b9136f11ac8fcffa2889ff01ee9bf4ad5b3","observation_id":"7c62af3d-ae64-4402-8bd8-d6ef711749f3","resolution":{"observed_at":"2026-07-31T09:42:44.554745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-07-31T09:42:44.604741Z","title":"DreamGen: Unlocking gener- alization in robot learning through video world models.arXiv preprint arXiv:2505.12705, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.604741Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:bcf3102472624d7986071b9f2ab03bef6281ac890ca9790379f70d75995e1c46","observation_id":"1281d8f6-b67f-4f29-b990-7242d043ecdc","resolution":{"observed_at":"2026-07-31T09:42:44.604741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-14T12:37:00.723011Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10104","snapshot_observed_at":"2026-07-31T09:42:44.654825Z","title":"Tsang, and Mike Zheng Shou","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.654825Z"},"links":{"cited_paper":"/paper/2602.10104","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:f8dd3e50ae78254e8d283c29a1fdaec52c374a1c4f434dde5b420af5751a14cb","observation_id":"6bb3bf1a-7a45-4fdc-aaef-54f4d41d3218","resolution":{"observed_at":"2026-07-31T09:42:44.654825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.694742Z","title":"Miradata: A large-scale video dataset with long durations and structured captions.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.694742Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:40b6b3c28e70854733e0df1b0071b10aef1695a0c04c80b6b2c88727fab4c14a","observation_id":"52553eb8-c1f5-4f2e-b376-4c63d57725ca","resolution":{"observed_at":"2026-07-31T09:42:44.694742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.744749Z","title":"Variational autoencoders and nonlinear ica: A unifying framework","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.744749Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:a422fff39ad9f48df43e79a90fd45fa20a52bf6da0277b2b6339628634afa3b0","observation_id":"0d3eec29-3623-4dfb-8290-29809d2a3d3c","resolution":{"observed_at":"2026-07-31T09:42:44.744749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.786083Z","title":"UniSkill: Imitating human videos via cross-embodiment skill representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.786083Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:7b6937e07f88d0038f2bcea94698d6477de4c5f6c4eac3270341ea9f4945ceb3","observation_id":"11560339-4106-40e8-a708-3d019fba05ee","resolution":{"observed_at":"2026-07-31T09:42:44.786083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-31T09:42:44.834746Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.834746Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:a938582a17a0d94c9f51dcd3ace07cdf549f33ca6ef7465e5097b3a81d621b3b","observation_id":"f723b869-1090-449f-811e-1fa79dc22363","resolution":{"observed_at":"2026-07-31T09:42:44.834746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.884745Z","title":"Generative video motion editing with 3D point tracks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.884745Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:4fc453abf01f7db87b9bcfaa722f76ca4759ee752e3a49bb0888140ebee55c58","observation_id":"dee87a8f-0485-4974-84ec-4f57ddb90ea1","resolution":{"observed_at":"2026-07-31T09:42:44.884745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16256","last_updated":"2023-12-29T08:49:49Z","snapshot_observed_at":"2026-08-13T04:54:06.001577Z","submitted_at":"2023-12-26T01:12:12Z","title":"DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16256","snapshot_observed_at":"2026-07-31T09:42:44.924748Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning- based 3d vision.arXiv preprint arXiv:2312.16256, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.924748Z"},"links":{"cited_paper":"/paper/2312.16256","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:2442aa3730cf919154a42f0bce0d99bf6032e5a0f0831caf6e4f1e10a33e1294","observation_id":"c78f43de-7002-4f13-ba4d-579a94f7c48e","resolution":{"observed_at":"2026-07-31T09:42:44.924748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:44.974743Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.974743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:a232e0f0a6317aa1355d408387e83e413b226c2c1ce7dd83a7f9911deea9b46f","observation_id":"a8f1255c-c39e-4f31-bee4-f89ec0c71300","resolution":{"observed_at":"2026-07-31T09:42:44.974743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.024740Z","title":"Challenging common assumptions in the unsu- pervised learning of disentangled representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.024740Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:d73fb2b61c1edb4d8366f8a0a8b51945c60f97766673f1d49529da2daaa101f7","observation_id":"5f235777-698b-48ce-9f9c-12c5fdcdd347","resolution":{"observed_at":"2026-07-31T09:42:45.024740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.064516Z","title":"Yume-1.5: A text-controlled interactive world genera- tion model.arXiv preprint arXiv:2512.22096, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.064516Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:7f348b1b9485397b6c443fa71365141391d60219f3c7412842e27501656144c3","observation_id":"5d5bd6d7-fb2e-4f77-afbc-6978adeb8ae9","resolution":{"observed_at":"2026-07-31T09:42:45.064516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.094743Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.094743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:ecd111715bcd4ad878f3c4581fb281c4ff34102c1d09b9454b5c624d295f98cf","observation_id":"396025ae-ef9d-456e-ac99-89ee1ff44062","resolution":{"observed_at":"2026-07-31T09:42:45.094743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.134742Z","title":"Genie 3: A new frontier for world models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.134742Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:98469b8547313d510217c6e779fec4be121ee2da8789f2e167172436d861f02d","observation_id":"2cd400f1-5b09-46ae-874c-f5bbae320e60","resolution":{"observed_at":"2026-07-31T09:42:45.134742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.174741Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.174741Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:761e639087e9b0303004e19d72ca2537fcaeb4321bdfb55dff1f212c8c9a5aaa","observation_id":"433409cf-c64c-44f8-97c3-431b1d2df5f9","resolution":{"observed_at":"2026-07-31T09:42:45.174741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.224756Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.224756Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:ef6d1026ed36546944d6cbf8f0f1a68793b667b39d378dc2e0250a34d7bda6dc","observation_id":"d2cb2b64-d458-49af-9166-5b348862d420","resolution":{"observed_at":"2026-07-31T09:42:45.224756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.254752Z","title":"Derpanis, and Kostas Daniilidis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.254752Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:1f07b02601028f4439e529d092516e5f7f8401d8a97bb57eecfd95ce5501519f","observation_id":"26238142-ea5e-4b8a-ba98-57ddc4d26a70","resolution":{"observed_at":"2026-07-31T09:42:45.254752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.294744Z","title":"MotionStream: Real-time video generation with interactive motion controls","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.294744Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:f018cdcb9b7311334b5e09b4df439125280009f75216fac0c372416a325a563d","observation_id":"74846c46-a311-4b97-8284-98ea7498c0c5","resolution":{"observed_at":"2026-07-31T09:42:45.294744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.374742Z","title":"A benchmark for the evalua- tion of RGB-D SLAM systems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.374742Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:05ee4438103df34799be2a67ddb4d176a85bbbebef3147bd218875f739b10de0","observation_id":"0f1f199a-cdfe-495c-b80a-da90c962969b","resolution":{"observed_at":"2026-07-31T09:42:45.374742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-14T16:23:20.854858Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-31T09:42:45.424739Z","title":"WorldPlay: towards long- term geometric consistency for real-time interactive world modeling.arXiv preprint arXiv:2512.14614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.424739Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:b51522e991983051b0d97d70d79d027b64ff40feb5793c30a83f7f0edbf3f149","observation_id":"4a951e2c-3d88-426c-b6ca-3cce94645f98","resolution":{"observed_at":"2026-07-31T09:42:45.424739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.474756Z","title":"Hunyuan-GameCraft-2: Instruction- following interactive game world model.arXiv preprint arXiv:2511.23429, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.474756Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:f56a6c2505fcf8ba715ca78899d288bdaa018c8f96ecdd98a7e7e3c46cda2a58","observation_id":"e805b93b-f423-4ab2-af04-ff8a40dc69bd","resolution":{"observed_at":"2026-07-31T09:42:45.474756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00425","last_updated":"2025-05-30T05:49:14Z","snapshot_observed_at":"2026-08-14T15:20:34.085631Z","submitted_at":"2024-10-01T06:10:39Z","title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00425","snapshot_observed_at":"2026-07-31T09:42:45.514747Z","title":"Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai.arXiv preprint arXiv:2410.00425, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.514747Z"},"links":{"cited_paper":"/paper/2410.00425","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:2f9c2d5c0322b77015b9885c0a2f0f9ea885655d9eedec529c49b2b587a3c0eb","observation_id":"43fe0fda-04ea-4bdb-ba3d-2b01be8bc169","resolution":{"observed_at":"2026-07-31T09:42:45.514747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-31T09:42:45.554829Z","title":"Advancing open-source world models.arXiv preprint arXiv:2601.20540, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.554829Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:f8ec47d8ec84956179e2d42b12a7e396b3334c04c9c3969b4b790296ef86a0f2","observation_id":"08b133a7-dbda-4fc1-baa8-067943f204a0","resolution":{"observed_at":"2026-07-31T09:42:45.554829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.604747Z","title":"Video- MAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.604747Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:93703448e13688a321d15c5d1c71a8090fc5afefc90f9ab0d2fc90c7c367333c","observation_id":"41f4eefd-9ff4-4fbf-8c48-830643bd144e","resolution":{"observed_at":"2026-07-31T09:42:45.604747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.664746Z","title":"Self-supervised learning with data aug- mentations provably isolates content from style","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.664746Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:eacdc76d1b6b9e2d39dd1e85949198316483f9c6cf66afa3832abd3fc3d6d5bc","observation_id":"3eb4b689-a80c-4e22-9a83-a7bb099515ed","resolution":{"observed_at":"2026-07-31T09:42:45.664746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-31T09:42:45.715044Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.715044Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:6935e03746e280ce920dda7cf54c2a70ec7cf6c11dfd3fc17d54151e261ee926","observation_id":"639b3838-19b3-4918-b9d7-ab953f42bac8","resolution":{"observed_at":"2026-07-31T09:42:45.715044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.754740Z","title":"VGGT: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.754740Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:43d7cb07d1c96e7a5a34a0a870f45991e8ad57713db618d9f6f14cd1814e30fa","observation_id":"4d23549d-0703-4a4f-b721-8caf0d5ddee8","resolution":{"observed_at":"2026-07-31T09:42:45.754740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26433","last_updated":"2026-04-06T15:21:53Z","snapshot_observed_at":"2026-08-14T04:51:37.057564Z","submitted_at":"2025-10-30T12:28:40Z","title":"Co-Evolving Latent Action World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26433","snapshot_observed_at":"2026-07-31T09:42:45.775224Z","title":"Co-Evolving latent action world models.arXiv preprint arXiv:2510.26433, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.775224Z"},"links":{"cited_paper":"/paper/2510.26433","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:b0bf92fdafa22a7ed75a97b7c4a09221f38d6aa86069eaa9a60e5fbc808d932c","observation_id":"7ac87890-768a-42b8-b744-82c34b53f473","resolution":{"observed_at":"2026-07-31T09:42:45.775224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.819531Z","title":"Connectionist nonparametric regression: Mul- tilayer feedforward networks can learn arbitrary mappings","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.819531Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:42a7227c15b4c11970d08d2b0492e8ae0d7043b13ec726fe32719f2153bf50f0","observation_id":"cb38dd9d-7174-467d-8b43-d12ba49e8857","resolution":{"observed_at":"2026-07-31T09:42:45.819531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.864743Z","title":"WorldMem: Long- term consistent world simulation with memory.arXiv preprint arXiv:2504.12369, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.864743Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:665ef1302c5fdc3c880a6981f48719e7a89426dc5bfa16fae94010047b89a921","observation_id":"5f4e422b-ff2c-42a9-a777-a78ebb36c969","resolution":{"observed_at":"2026-07-31T09:42:45.864743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-13T16:50:22.485805Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-07-31T09:42:45.914747Z","title":"CoMo: Learning continuous latent motion from in- ternet videos for scalable robot learning.arXiv preprint arXiv:2505.17006, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.914747Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:25fec1ef0cbb97d2bbdab0edf429e1b7835f4622ee7e65bb3478bbdf9727221b","observation_id":"8baa9522-1109-4440-8095-57ac4bc1d5e1","resolution":{"observed_at":"2026-07-31T09:42:45.914747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.954745Z","title":"Latent Action Pretraining from Videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.954745Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:e3c63d91c6ebc5aa9e0eee81cf54ee01953b9fe9a7aea221732a015cb4014176","observation_id":"cd31a456-41b9-424a-a857-8308ed90a1c8","resolution":{"observed_at":"2026-07-31T09:42:45.954745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:45.994742Z","title":"MIND: Benchmarking memory con- sistency and action control in world models.arXiv preprint arXiv:2602.08025, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:45.994742Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:f6534ab901527fbd91ff9136252ab7b7b8dc57a3556a52543e8f3f29a3bec093","observation_id":"d774304a-a384-43a0-a20d-22c284e775bb","resolution":{"observed_at":"2026-07-31T09:42:45.994742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:46.034739Z","title":"GameFactory: Creating new games with gen- erative interactive videos.arXiv preprint arXiv:2501.08325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:46.034739Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:9b06d9cc1ee1d83d4a5c96521af1c1ec2a18a56724fcb60d44cc7dde7858ed38","observation_id":"9f5894cd-aaa3-462e-96aa-e09344300f3d","resolution":{"observed_at":"2026-07-31T09:42:46.034739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T09:42:46.084741Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:46.084741Z"},"links":{"citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:a0d85ce9a4d1b4d0165c1bc062f93e45f90841983d6f03a2938c9629ceaf70ca","observation_id":"dbc12a0c-5b67-4b8d-b0de-0d00444cf8cd","resolution":{"observed_at":"2026-07-31T09:42:46.084741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18601","last_updated":"2026-07-12T15:36:26Z","snapshot_observed_at":"2026-08-13T03:42:10.941508Z","submitted_at":"2026-05-18T16:12:52Z","title":"Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18601","snapshot_observed_at":"2026-07-31T09:42:46.124953Z","title":"replay the dynamics, resample everything else","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:46.124953Z"},"links":{"cited_paper":"/paper/2605.18601","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:09f281c4482ea8918045470fc018dbd08d3e3821bee904574a8f8c1d4182b33f","observation_id":"f83cb955-d2ab-4a4a-b43e-b1ea3f7b082e","resolution":{"observed_at":"2026-07-31T09:42:46.124953Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.28362."}