{"as_of":"2026-08-09T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebd0c7223f84f48927dbb5818e8e409059d993a0ba253c575c48135adaa4a147","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:08:11.723353Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16192/citation-record","integrity":"/paper/2607.16192/integrity","json":"/paper/2607.16192/citation-record.json","paper":"/paper/2607.16192"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:02.926217Z","title":"Gibson.The Ecological Approach to Visual Perception","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:02.926217Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:20595f296e12ef1e8283afe3fa4853a3780c44e9331bece01cf5a06d2b918982","observation_id":"5d39d198-f022-4dfb-a2e2-1d4a6c753b96","resolution":{"observed_at":"2026-08-01T21:08:02.926217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:02.996305Z","title":"MIT Press, Cambridge, MA, 1979","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:02.996305Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:6b07af41996fb70cbcabadd7e8071476cfb7fd074e5db77760d5cf2ff3a9d356","observation_id":"d03305c0-239c-434e-a55a-57363f14e8a7","resolution":{"observed_at":"2026-08-01T21:08:02.996305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.065262Z","title":"Battaglia, Jessica B","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.065262Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c13f386023d5f8e63860ccaddc111c87dacbfe310daa334979e48e36fbac0efb","observation_id":"bbd53c76-1089-4357-a1b9-ab23afc9f07b","resolution":{"observed_at":"2026-08-01T21:08:03.065262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/415755a","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rational imitation in preverbal infants","venue":"Nature","work_id":"d182a40c-cb61-428d-95d7-5c70936edba7","year":2002},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.205525Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:3ae4fbbff5aa776175b04749f9e016e87ee8171ec921542a2360f1d3b8df390d","observation_id":"d0e28455-666f-445c-abff-0edd9914eabd","resolution":{"observed_at":"2026-08-01T21:08:35.157213Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18558","last_updated":"2026-06-17T00:19:00Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-17T00:19:00Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","version":1},"cited_work":{"arxiv_id":"2606.18558","doi":"10.48550/arxiv.2606.18558","metadata_source":"pith","pith_arxiv_id":"2606.18558","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","venue":"cs.CV","work_id":"0f33a82e-e8d3-42dd-8b49-b35bbfbb9e02","year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.318004Z"},"links":{"cited_paper":"/paper/2606.18558","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:8a8a236812d3e367632a293f31716ff5f580a916fe4b9ab67af6606d126e88ef","observation_id":"2d2c935f-c823-4426-a51b-c3b1b8deba94","resolution":{"observed_at":"2026-08-01T21:08:34.903088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03605","last_updated":"2025-06-04T06:28:16Z","snapshot_observed_at":"2026-08-08T19:12:57.330137Z","submitted_at":"2025-06-04T06:28:16Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","version":1},"cited_work":{"arxiv_id":"2506.03605","doi":"10.48550/arxiv.2506.03605","metadata_source":"pith","pith_arxiv_id":"2506.03605","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision","venue":"cs.CV","work_id":"e97989cf-b4de-49f9-842c-6dda264f5663","year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.385771Z"},"links":{"cited_paper":"/paper/2506.03605","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4a3540e1a97470169a1ff89ed61d34e9a7771effa64e5e5dd5b453df31b242b8","observation_id":"8bda7ddf-e769-428a-b03a-0e6824903cce","resolution":{"observed_at":"2026-08-01T21:08:34.652209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.492409Z","title":"ObjectForesight: Predicting future 3d object trajectories from human videos.arXiv preprint arXiv:2601.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.492409Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a8b2aaabddf64e4c0150fb2fd4c06ed273a57a2d202a5f0bac3cd6e4d6b7917d","observation_id":"1cf48797-d72c-4276-9406-c87c7738e523","resolution":{"observed_at":"2026-08-01T21:08:03.492409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.635971Z","title":"Track2Act: Predicting point tracks from internet videos enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.635971Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1aab57b62e9973b878941db2797e09696a1a9f9595ae803a918a806150cff7e1","observation_id":"c80709e4-a0dd-4dd1-99f0-f06e8c906c05","resolution":{"observed_at":"2026-08-01T21:08:03.635971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.706598Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.706598Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:5affd2dfccf6ba78377075ee1a074299bf3e7a2ed0801a3aafe66be1cede407e","observation_id":"bce010d1-35c8-4f0b-86fa-a15beb351f7e","resolution":{"observed_at":"2026-08-01T21:08:03.706598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.861656Z","title":"Motion tracks: A unified representation for human-robot transfer in few-shot imitation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.861656Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:155cf98967a121823c07134775fa4bc798357a50f79ef61ffc876f280f0faf6c","observation_id":"9690d49b-e4c6-466d-b566-0dadabbccf18","resolution":{"observed_at":"2026-08-01T21:08:03.861656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12587","last_updated":"2026-05-12T17:59:27Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:27Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","version":1},"cited_work":{"arxiv_id":"2605.12587","doi":"10.48550/arxiv.2605.12587","metadata_source":"pith","pith_arxiv_id":"2605.12587","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","venue":"cs.CV","work_id":"81730fcd-2b29-4303-84a2-3875fe51a96d","year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.956642Z"},"links":{"cited_paper":"/paper/2605.12587","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1640465853f538852087f8745165675abcec1363c2eb741c55369775d8cc353a","observation_id":"e64d958b-996c-4fcc-9cfe-ccb10ac21c48","resolution":{"observed_at":"2026-08-01T21:08:34.345489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T21:08:04.041568Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.041568Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a2dd443e00fd771a48b5cceeea0d228dc45203e38408a6ee3adb08ac3cee18d9","observation_id":"087b81c3-1dc9-4d99-ba17-7b733fff36da","resolution":{"observed_at":"2026-08-01T21:08:04.041568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-01T21:08:04.239228Z","title":"World models.arXiv preprint arXiv:1803.10122, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.239228Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:aa907cec74431254902d69451243e8d4021bd370513d720a111d1f50f75f123f","observation_id":"3f0398c3-181a-41c3-b9a5-97ec90990127","resolution":{"observed_at":"2026-08-01T21:08:04.239228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.319399Z","title":"Deep visual foresight for planning robot motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.319399Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:81029047e6ad00b52a5dd6c58c05ed708dec4f84443c846d8a7eb3afadd41a80","observation_id":"d9b9b770-c82c-46d0-8c57-c891333c70aa","resolution":{"observed_at":"2026-08-01T21:08:04.319399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.476158Z","title":"Decomposing motion and content for natural video sequence prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.476158Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:471ef00071158847c6d66895d4d3d48c3e6a1c93614041742991cb5663996f58","observation_id":"c87fa03f-70e7-46f4-8821-70dae328a2a8","resolution":{"observed_at":"2026-08-01T21:08:04.476158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.580212Z","title":"An uncertain future: Forecasting from static images using variational autoencoders","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.580212Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:e6af0694923f57f8f0dba9997891bc4611d1382c0bb4e2e529bb69d19ddb088a","observation_id":"753e912b-c894-4b5d-9962-357c5d639f3b","resolution":{"observed_at":"2026-08-01T21:08:04.580212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.670644Z","title":"Gen2Act: Human video generation in novel scenarios enables generalizable robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.670644Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:89eb070e807e434db71a81e834ed4cc84ee2cf137271fde09edc917f62e8b6fc","observation_id":"a50c7708-3445-4e27-839f-f57d9922ba80","resolution":{"observed_at":"2026-08-01T21:08:04.670644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.888292Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.888292Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:60e1e8e89eaad5b9774bed107413ee67eebd092ee29d7570c7eccb39e22af5c3","observation_id":"1100d987-5939-4465-b9b4-f12699bcbece","resolution":{"observed_at":"2026-08-01T21:08:04.888292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-08-01T21:08:04.972434Z","title":"Video generators are robot policies.arXiv preprint arXiv:2508.00795, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.972434Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:ac1239ad5cc25faa75afe49dbcacedf44849368a163a26d94fc49d63dafab78a","observation_id":"7f9ff0f1-8422-46a8-be47-7dbe75bb07f2","resolution":{"observed_at":"2026-08-01T21:08:04.972434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.054514Z","title":"Learning latent action world models in the wild.arXiv preprint arXiv:2601.05230,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.054514Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d7f2d706783b9cc3f6f8e5ffbf789daa1d3843dfa72c713ad29d0f28afee5df4","observation_id":"8e4f0d75-d026-45bd-97a7-bd898ba0f5c4","resolution":{"observed_at":"2026-08-01T21:08:05.054514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-01T21:08:05.241430Z","title":"V-JEPA 2: Self-supervised video models enable understanding, prediction and planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.241430Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:90a5336433f97774a0c7056ef35c10bcd7a211f258d3581ff94ddc3eedc0fe70","observation_id":"9ed41a93-fa35-4286-901f-ac6f8d820a08","resolution":{"observed_at":"2026-08-01T21:08:05.241430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.752345Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.752345Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b12711313ff81adb00d122af33180cd21a6f5a589554edf76d6561279c5f4a6c","observation_id":"4b9539c2-08a6-45ce-b59c-5ae20fb9871b","resolution":{"observed_at":"2026-08-01T21:08:04.752345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.465352Z","title":"Contrastive learning of structured world models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.465352Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:bc50e1a3001725c9093a7f8bf3ee04a5bbcc52464553419b3fc4ba40a03d252f","observation_id":"32141199-f808-498b-9cc5-f0bb2f6023c9","resolution":{"observed_at":"2026-08-01T21:08:05.465352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.533345Z","title":"SomethingSomething","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.533345Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b2a695fe3ce7d2fd20a19011de45b8c465e42a5591201c94e274b44abcf726b1","observation_id":"02b630b1-2d65-4c8a-b075-e9e626c7878b","resolution":{"observed_at":"2026-08-01T21:08:05.533345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.662287Z","title":"Doell, and Jason J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.662287Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:c0afccbb3e46d1022e3195a7260a8f25219acbb3ccc7ed91f1f9657e87a20c74","observation_id":"1bbda2fb-e58b-4128-8d26-d3346919153a","resolution":{"observed_at":"2026-08-01T21:08:05.662287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.136592Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.136592Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:756fff23755b57ec0150b159d666f43d208583051632a4a141a901071ff48f53","observation_id":"8cdc7013-fb8c-43fa-ad6a-df4845f3e0b4","resolution":{"observed_at":"2026-08-01T21:08:05.136592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.835753Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.835753Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b307087315ce71d5fef74d6129d0d12efd9b5112bdbaf2fbb3a940074b650da5","observation_id":"473d728d-24be-4b5f-87cf-02ee5cfcb27b","resolution":{"observed_at":"2026-08-01T21:08:05.835753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.350557Z","title":"Dream to con- trol: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.350557Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:f61e94e696c310fbb0b3a58073d0653be8b229bfed751e09ec8c66cb9cb8434c","observation_id":"953f0aa9-b9fd-459b-ba01-e36412422fb6","resolution":{"observed_at":"2026-08-01T21:08:05.350557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.980579Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.980579Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:dcaa31259004217e2ff7f4b012632780ee94c4fc786b529b2e60e6f3f36c521f","observation_id":"bd1e8057-cea0-43dd-baf6-d87a3ac50b93","resolution":{"observed_at":"2026-08-01T21:08:05.980579Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.043040Z","title":"Human–object interaction prediction in videos through gaze following.Computer Vision and Image Understanding, 233: 103741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.043040Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d6e84cf8ffa295c815b86c0fd18bcc7488efb788ca8af8bb1006f5e1e1aed45a","observation_id":"4a1824d8-df7d-4e9a-b31c-c7bb4249840b","resolution":{"observed_at":"2026-08-01T21:08:06.043040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.111870Z","title":"ContactGrasp: Functional multi-finger grasp synthesis from contact","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.111870Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2857a27322bf19728ef6670db3e70d3e949e77c3dc0b0440f7b2d5974a5c42da","observation_id":"28f98bed-959a-4dfa-a104-25a34c397f0c","resolution":{"observed_at":"2026-08-01T21:08:06.111870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.753292Z","title":"Scaling egocentric vision: The EPIC-KITCHENS dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.753292Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:5e3dab9c42763170568421803eed5b7a2b767892bd80f65345ebf296d196a79d","observation_id":"f4b6d1d4-f3e4-4285-95bb-caece6d5123b","resolution":{"observed_at":"2026-08-01T21:08:05.753292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.267788Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.267788Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a5674981d2490aac21219dd6050aa6270fa0e3f8f1091231d486c13187a28877","observation_id":"6600dc5b-fb2b-45f6-be4f-83e9b0bfee58","resolution":{"observed_at":"2026-08-01T21:08:06.267788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:05.917618Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:05.917618Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2dacf22989571bc2f6bf9d70930100de6feb55edc8853021c021d233328f7577","observation_id":"a96a30c3-7ded-4cbc-9596-7776ff9e10c2","resolution":{"observed_at":"2026-08-01T21:08:05.917618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.410635Z","title":"Newtonian image understanding: Unfolding the dynamics of objects in static images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.410635Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:41a0594bffc49b6d27e23d4ff8744b8ddc033117feb8e327e7bb009a0acc0a74","observation_id":"9861203a-874f-4111-bbe6-da276283adea","resolution":{"observed_at":"2026-08-01T21:08:06.410635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.482696Z","title":"Grounded human-object interaction hotspots from video","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.482696Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2f10ef6eac0f75711d8addc0d35707fc857856496032d9dc768e5fc33ead3084","observation_id":"25f96095-8223-46c0-8564-fe4458022f59","resolution":{"observed_at":"2026-08-01T21:08:06.482696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.542986Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.542986Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7231c37b2bc3db9a6837661889f071584fdba3244bb56405db120a5ac5c73d00","observation_id":"d35973f7-524c-441d-b48e-44a2322d0f3d","resolution":{"observed_at":"2026-08-01T21:08:06.542986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.187309Z","title":"Human hands as probes for interactive object understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.187309Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:0c967fc9f58b95584d18272e32de089855b4c7d120068969f68781c86fa271fc","observation_id":"77876ee3-c8f6-420f-bd4d-343a2f6197ff","resolution":{"observed_at":"2026-08-01T21:08:06.187309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-01T11:11:47.133079Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13187","snapshot_observed_at":"2026-08-01T21:08:06.701306Z","title":"Hand- sOnVLM: Vision-language models for hand-object interaction prediction.arXiv preprint arXiv:2412.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.701306Z"},"links":{"cited_paper":"/paper/2412.13187","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:24f0c8da245fc13a051458f1c01a51123281d1b9db08355d05620e0cc408ba27","observation_id":"89482c55-4d31-4fb9-8ee6-08a30eaafcdd","resolution":{"observed_at":"2026-08-01T21:08:06.701306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.350657Z","title":"Guibas, Mustafa Mukadam, Abhinav Gupta, and Shubham Tulsiani","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.350657Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9f189936444a36dfe710c0decd8582cb69fa007d51436ce4f2eb3cc98231739c","observation_id":"1b0d3e2b-9ea3-4c8f-a196-90e97a5d8159","resolution":{"observed_at":"2026-08-01T21:08:06.350657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.862084Z","title":"Mask2Act: Predictive multi-object tracking as video pre- training for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.862084Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:5fa4ce5514bea5e043f9ea79b9fa542a0b7fac019f0c2a9d9512f60ab4bb5e52","observation_id":"40f5bd1d-9f4e-44de-8485-c8dfc00899db","resolution":{"observed_at":"2026-08-01T21:08:06.862084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.937012Z","title":"3d hand shape and pose estimation from a single RGB image","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.937012Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:1a374d257ec7311edc4fb79d3d8294a6e450274e2bf94b60d765c3d9920c6bc8","observation_id":"15ac6c39-325d-4f71-8259-117316dd7cce","resolution":{"observed_at":"2026-08-01T21:08:06.937012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.997853Z","title":"Black, Ivan Laptev, and Cordelia Schmid","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.997853Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:597333844130d281d00bbf65c1b1d99a74f774a9723d46a3209e875b205eed0b","observation_id":"67cc1d18-74fd-4728-86f7-c66bb7808793","resolution":{"observed_at":"2026-08-01T21:08:06.997853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.621031Z","title":"Guide to the carnegie mellon university multimodal activity (CMU- MMAC) database","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.621031Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d48bf3e12b48cf68bf2b15d994ab8ebc50c76bab72775d9af1068daa761cd997","observation_id":"a11e4dc1-4bf6-415b-8744-3c91d1691522","resolution":{"observed_at":"2026-08-01T21:08:06.621031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08324","last_updated":"2020-08-19T08:22:30Z","snapshot_observed_at":"2026-08-09T05:55:20.496445Z","submitted_at":"2020-08-19T08:22:30Z","title":"FrankMocap: Fast Monocular 3D Hand and Body Motion Capture by Regression and Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08324","snapshot_observed_at":"2026-08-01T21:08:07.169924Z","title":"FrankMocap: Fast monocular 3d hand and body motion capture by regression and integration.arXiv preprint arXiv:2008.08324, 2020","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.169924Z"},"links":{"cited_paper":"/paper/2008.08324","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:91d272f323a0b53cf03e3fceb175ac659f980882b9a995713dbb1b8e70650679","observation_id":"3220aa4f-8613-4118-85e8-fc111bbb4453","resolution":{"observed_at":"2026-08-01T21:08:07.169924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:06.765398Z","title":"Flowing from reasoning to motion: Learning 3d hand trajectory prediction from egocentric human interaction videos.arXiv preprint arXiv:2512.16907, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:06.765398Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:0ebf0b500128337a66f6440ba11b94421a009f6a89711d4b6c771bb4af149251","observation_id":"d9bdb4bc-e81e-437a-8366-c16a7e260967","resolution":{"observed_at":"2026-08-01T21:08:06.765398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.512912Z","title":"PVN3D: A deep point-wise 3d keypoints voting network for 6dof pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.512912Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:cb8393c68933489a2b8391e7939d042e6cb4f51a59593c915669dedbdb885812","observation_id":"1fe054e9-fb57-44f8-829e-1c20f51eed55","resolution":{"observed_at":"2026-08-01T21:08:07.512912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.668258Z","title":"Segmentation-driven 6d object pose estimation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.668258Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:8226d732338a461371660102e42675913a7225436f05403e70a76f4b3486583d","observation_id":"faf6970f-f887-4b33-88b6-96d3a0ea3221","resolution":{"observed_at":"2026-08-01T21:08:07.668258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.824655Z","title":"SSD-6D: Making RGB-based 3d detection and 6d pose estimation great again","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.824655Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9ffd443f6160ba47f99da0657ba44db10038253b3a65946720aab6d087b3fde8","observation_id":"d98d81c3-be80-42ac-9b5e-29ad52b51ad2","resolution":{"observed_at":"2026-08-01T21:08:07.824655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.013467Z","title":"Hand pose estimation via latent 2.5d heatmap regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.013467Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4aa10b7e7f1e8f5fe882a492bc0636a172521a5f551935ab721430fc9abd44d5","observation_id":"ed9f48a8-f0cb-4d1e-a57b-8940e5e0bfde","resolution":{"observed_at":"2026-08-01T21:08:07.013467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.108094Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.108094Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:de2960c4d004d063c3a3307e5904fcbde89bc6b3ef9266ad4a8da84ab1e60372","observation_id":"194c8f67-903d-4bc5-843f-52ea3333300a","resolution":{"observed_at":"2026-08-01T21:08:08.108094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.316576Z","title":"Learning to estimate 3d hand pose from single RGB images","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.316576Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4c9262088762b49ce94de2fe04de0ce3e150b6acf7f95d5ddf0aa7f035759515","observation_id":"dcc1f61a-bf86-45de-acd4-d0d05a6e7958","resolution":{"observed_at":"2026-08-01T21:08:07.316576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16624","last_updated":"2025-11-20T18:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:31:46Z","title":"SAM 3D: 3Dfy Anything in Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16624","snapshot_observed_at":"2026-08-01T21:08:08.479185Z","title":"Liang, Alexander Sax, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.479185Z"},"links":{"cited_paper":"/paper/2511.16624","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:018be781b81c1bc3ed0b609f6d0f474abe349b57d192ecfa9c2c509ff42c6067","observation_id":"cb77d25c-bb1b-41b1-af3d-7341aa9f23b9","resolution":{"observed_at":"2026-08-01T21:08:08.479185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.666083Z","title":"Self-supervised point cloud prediction using 3d spatio-temporal convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.666083Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:3f7ad4f4b1112830c34959210bee011748bde802fa2192fc27e5282000c4a32c","observation_id":"b8676e74-e36d-49b0-b586-145764dc2d84","resolution":{"observed_at":"2026-08-01T21:08:08.666083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.071412Z","title":"Visual point cloud forecasting enables scalable autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.071412Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:f3b9ed731d0010cb37ce7d7a7455e80b468d831c22edd5b507b2fbf69f0271de","observation_id":"dcb1968e-f585-4a5f-b4fc-df833d9e205d","resolution":{"observed_at":"2026-08-01T21:08:09.071412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:07.942149Z","title":"PoseCNN: A convo- lutional neural network for 6d object pose estimation in cluttered scenes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:07.942149Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:367648916b4c3f010badc98ccb7acb4b904b758d741a29e40bd1b7323715579d","observation_id":"2afc36e2-8916-407f-a0dd-8b9557e5cfc2","resolution":{"observed_at":"2026-08-01T21:08:07.942149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.493365Z","title":"ManipTrans: Efficient dexterousbimanualmanipulationtransferviaresiduallearning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.493365Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:180e9efa0da38445acefd694888239ec42e99bfd108fe264c04cda79d50376f9","observation_id":"4fc5edd6-1945-4d90-96e5-ff75231c0e07","resolution":{"observed_at":"2026-08-01T21:08:09.493365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.328003Z","title":"Structured 3d latents for scalable and versatile 3d generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.328003Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7732d10847671ffc317509aa6cce13c3603089c76a4e466e9088b877a009beed","observation_id":"502a4ad2-0f4d-458c-8697-ea0593e37f38","resolution":{"observed_at":"2026-08-01T21:08:08.328003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.950434Z","title":"World models for learn- ing dexterous hand-object interactions from human videos.arXiv preprint arXiv:2512.13644,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.950434Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7c6eb2d52cccca5755366e863bb37ef8d33ab1677632eb0e4eaf9d072696c90c","observation_id":"3dbe438d-aa1a-46c2-81a9-1f624dfa8f43","resolution":{"observed_at":"2026-08-01T21:08:09.950434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.208378Z","title":"Qi, and Leonidas J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.208378Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:af36f24c2ed30e33c1d4fa918a2f4ac688cc58c096cdedb9302114aed2761571","observation_id":"46e02707-70f1-4da8-b826-125d87fe3ebe","resolution":{"observed_at":"2026-08-01T21:08:10.208378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.378846Z","title":"Harley, Yang You, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Suya You, Rares Ambrus, Katerina Fragkiadaki, and Leonidas J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.378846Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:b28118c38a1b7f0d4c4fe5cd5f0c1180a3dff16043b7da421f7688f6e383a086","observation_id":"5dc331fd-2879-43ad-b8c8-0ca2850087af","resolution":{"observed_at":"2026-08-01T21:08:10.378846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.331914Z","title":"ViP3D: End-to-end visual trajectory prediction via 3d agent queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.331914Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:87854abde6f338ab9dca88436f57448d3bb48b8ae30ee7240b1a43da59dc43ff","observation_id":"dc4884ea-653d-4f14-8da4-9e7b9ec9ede5","resolution":{"observed_at":"2026-08-01T21:08:09.331914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.583837Z","title":"DELTA: Dense efficient long-range 3d tracking for any video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.583837Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:99d3ba54c19ac4c120e0e55f11f7b6eabac4cad3c206b3c8b09a0eb3e939704a","observation_id":"3a497286-20c1-4af7-8ded-d241fcc3674c","resolution":{"observed_at":"2026-08-01T21:08:10.583837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:09.689219Z","title":"PointWorld: Scaling 3d world models for in-the-wild robotic manipulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:09.689219Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:98e8e416750666810be328142b13e4a88129cb072f9d9411ecac0c8f4bc9fbf4","observation_id":"ee2324a4-746d-4784-92aa-399747a27aee","resolution":{"observed_at":"2026-08-01T21:08:09.689219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.736636Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.736636Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:e0bc4d931c80e2272102ce529b8fd81e7153873ca9086b86ea925157d594406f","observation_id":"b8eef71c-872c-4323-ad24-6e9a93874599","resolution":{"observed_at":"2026-08-01T21:08:10.736636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.084810Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.084810Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:dc020d1b858f72bb9cb255585504bd299a3238a4e57d3e5a2f92f5211bc32d8b","observation_id":"22762334-5b6f-4e3a-814d-57776dd59222","resolution":{"observed_at":"2026-08-01T21:08:10.084810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.885000Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.885000Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:d68e6419035fc47c235eebe28ca86a18c8c470bc731a0173ed73323d80a2b7fb","observation_id":"9945e0b2-8aa4-4742-8f1b-2ab3d85d5b77","resolution":{"observed_at":"2026-08-01T21:08:10.885000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.959228Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.959228Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:83aa5d7b0c0af9a4997f5cb2cb06ca4f4a6697901172385c9b8868a96da38860","observation_id":"45d21f6d-d9e4-4841-98a2-8f6bac3fdb2f","resolution":{"observed_at":"2026-08-01T21:08:10.959228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.020780Z","title":"Forecasting motion in the wild.arXiv preprint arXiv:2604.01015, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.020780Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:5c7ca84961aae31dec2736a984f9c78f401ba1371d24548eb96f3ba044b50a3e","observation_id":"b384054c-23ba-4e3f-8b4a-7b90cd4f43d1","resolution":{"observed_at":"2026-08-01T21:08:11.020780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73033-7_2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoTracker: It is better to track together","venue":"Lecture notes in computer science","work_id":"6c536829-a041-4f5c-a38f-258306fb1ce1","year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.509167Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:90c2744b74853cc013e747f779149f41c8a491f1f112367e9d0f8d366b7c3cc4","observation_id":"218eedf8-6a4e-47af-b1ce-64c29abedf4b","resolution":{"observed_at":"2026-08-01T21:08:32.681179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.168088Z","title":"Dex4d: Task-agnostic point track policy for sim-to-real dexterous manipulation.arXiv preprint arXiv:2602.15828, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.168088Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:e1146dfb56131b62846625acc70cb136c866b5ff264eba0cfbc30873d9afbd9e","observation_id":"29f1935a-8d90-4b9a-8ac9-c3402ed5817d","resolution":{"observed_at":"2026-08-01T21:08:11.168088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:10.659830Z","title":"SpatialTrackerV2: Advancing 3d point tracking with explicit camera motion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.659830Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:e82f7f7201d2115c43d9a6a06cef3d88b70faf63555f79fb1246f04429b7ba3d","observation_id":"dab819f2-27b4-431b-a2f5-2b9340d0b476","resolution":{"observed_at":"2026-08-01T21:08:10.659830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-01T21:08:10.829759Z","title":"Chen, Zhenyu Li, Guang Shi, Jiashi Feng, and Bingyi Kang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:10.829759Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:12975d057bb151ce279a349036cfcc166e7a843f628d485c57fb96f3bd11a09a","observation_id":"0df9acc1-845c-4247-8e25-1e2ab0283843","resolution":{"observed_at":"2026-08-01T21:08:10.829759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.091720Z","title":"Novaflow: Zero-shot manipulation via actionable flow from generated videos.arXiv preprint arXiv:2510.08568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.091720Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2f8cacac93f50e8c30b343902f775f8f26b3597f9fae898b560a663055b2b036","observation_id":"2aabca53-94dc-459b-b35b-8a32fefaae46","resolution":{"observed_at":"2026-08-01T21:08:11.091720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.236120Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.236120Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:7447a4767d79ebbe11f48e11b32c453477004dcadc594c31e86ff7bafbe0d4ab","observation_id":"225639f7-6d36-48ae-9fb9-93d6691cd78b","resolution":{"observed_at":"2026-08-01T21:08:11.236120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.340760Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.340760Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:307fb8678922288a08d7b625d805dff55ce1fd1f76e8123376dbfe5d62017ad5","observation_id":"e0ff0579-802d-4d89-8adf-0d50cae0a32c","resolution":{"observed_at":"2026-08-01T21:08:11.340760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.404206Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.404206Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9e943e7484ff5a06195f42bd5d14ecff8c9d3323f471146112eaeac6e9ee78e6","observation_id":"1b81fa00-33dc-4cb1-8b1b-1c4f1e3e5ec9","resolution":{"observed_at":"2026-08-01T21:08:11.404206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.475358Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.475358Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:a7539ae05b25695a4a232b72f13fdfe2d5f2cd7c4140d1abf6bde95b24b7058f","observation_id":"85254c77-8344-4712-8298-2d49a303b335","resolution":{"observed_at":"2026-08-01T21:08:11.475358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.548643Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.548643Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:58e2ffdfce79f7267cb78b6346fc93be9e63b356b1b4b141a1560e5a93a2f4fb","observation_id":"64ddfc8a-ec61-479e-b968-9441e5b204aa","resolution":{"observed_at":"2026-08-01T21:08:11.548643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.616413Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.616413Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2bb8602b5bbdb26ff50b0714bfd3cbc297b5dae030494d8c0b203fc8756265e3","observation_id":"6edb8e74-a3d3-43b1-bbd8-6c67248d4b81","resolution":{"observed_at":"2026-08-01T21:08:11.616413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.674282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.674282Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:e6898da83c3c1c25187918e3c44a7ebd1f65367a81d0a6a65046623662b8106a","observation_id":"97f24870-0ae4-4162-b1ed-48869ff97e3e","resolution":{"observed_at":"2026-08-01T21:08:11.674282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:11.723353Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:11.723353Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:69e697f1d5c80affa5380fe0ceaedcaf224cd8627a3ef48aabcab972b18c2bf7","observation_id":"9737f7df-901c-4a8f-8d77-c0d90c9acfbb","resolution":{"observed_at":"2026-08-01T21:08:11.723353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:04.392981Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.392981Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:9be1903ef8be1c131812e50911b21c56ffef6e97296f05e8bb1f5786c5cbbb41","observation_id":"53b09f4e-3d7b-41bc-b8f2-9c61fe2a1288","resolution":{"observed_at":"2026-08-01T21:08:04.392981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:08.839813Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:08.839813Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:4e87ad008cb2824b49800a6974a60cf6dd369ee28ccc6bab0e3ed3b2297d3ae9","observation_id":"e4605b7f-e1b6-4231-afec-c042f6cc3452","resolution":{"observed_at":"2026-08-01T21:08:08.839813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.774833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.774833Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:bf0b265dd4fc29396167eaa037a9f164de8b3e3349003206f1f9527629fbc6ac","observation_id":"7de84400-49ce-4983-b129-bec74691297c","resolution":{"observed_at":"2026-08-01T21:08:03.774833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T21:08:04.131033Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:04.131033Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:2a5b877a973fb86f0b25f03b0b882566d04b651e9dc3f0ba8f826e6088440a91","observation_id":"9ca762a5-3b80-460d-8ae4-1e7ab71e8bfd","resolution":{"observed_at":"2026-08-01T21:08:04.131033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:08:03.567786Z","title":"12 MotionForesight Brains, Bots, and Behavior Lab","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T21:08:03.567786Z"},"links":{"citing_paper":"/paper/2607.16192"},"observation_digest":"sha256:8c6c35ae6ba24103d4376f6bdea8718b9ba4a1ff4be46ec0405fac9f5e01cc92","observation_id":"cea0f0cd-1890-4e9b-9bfa-af71316ad47c","resolution":{"observed_at":"2026-08-01T21:08:03.567786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16192","last_updated":"2026-07-17T17:59:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:53:32.250187Z","submitted_at":"2026-07-17T17:59:38Z","title":"MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2607.16192."}