{"as_of":"2026-08-20T18:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f422f2f66bdffd5ef06d008ccb238a4116fa6c5004b1b87703fbe1cf989b2588","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:33:00.845679Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:04:26.253123Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-08-15T00:36:59.684390Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:8ab1d4d11830c5b360e700f29a6d4130200e541dc103428c7cdce78336210a60","observation_id":"7bf51a50-cdb3-450e-b276-1f093362f7a4","resolution":{"observed_at":"2026-05-15T12:17:01.445669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-12T00:04:08.852974Z","title":"Dreamitate: Real-world visuomotor policy learn- ing via video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01987","last_updated":"2025-03-24T19:50:08Z","snapshot_observed_at":"2026-08-14T02:39:08.853226Z","submitted_at":"2024-12-02T21:40:17Z","title":"ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:04:08.852974Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2412.01987"},"observation_digest":"sha256:42b10236a0e4017ac0469aa56cef5f8fd714eedd0ea1b20eafea7e205c1d9e28","observation_id":"e15e0d37-d20b-425f-9fbd-a0e04fa81b58","resolution":{"observed_at":"2026-08-12T00:04:08.852974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-11T18:07:55.135473Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08261","last_updated":"2025-02-16T03:13:51Z","snapshot_observed_at":"2026-08-20T13:40:03.402567Z","submitted_at":"2024-12-11T10:17:00Z","title":"FLIP: Flow-Centric Generative Planning as General-Purpose Manipulation World Model","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T18:07:55.135473Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2412.08261"},"observation_digest":"sha256:8b94db10a4d2178f3545333f7abcb92953a7144bb3d8fa2c4acc41f871af7e9e","observation_id":"7dd9c07c-e3d5-463b-af48-43e754b0d8bb","resolution":{"observed_at":"2026-08-11T18:07:55.135473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-10T22:17:23.336245Z","title":"Dreamitate: Real-world visuomotor policy learn- ing via video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-20T17:46:54.459933Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-08-10T22:17:23.336245Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2501.02189"},"observation_digest":"sha256:dbd12bb81c8f00c0fbb5b75fd301ecfa56a0b3ec7d03fe5fbad3b4d1702702d4","observation_id":"47002f1c-9acb-431e-977a-2ac912fdc0ca","resolution":{"observed_at":"2026-08-10T22:17:23.336245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-09T14:33:35.423656Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-15T04:58:12.731526Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.423656Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:414516cbc9b6b5545ee51780ca965a0b32a2afbfa7b67e0ba58a39d785d7a75f","observation_id":"44dfe1b6-7bd1-4773-b452-2a379feef768","resolution":{"observed_at":"2026-08-09T14:33:35.423656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:1428af793a4ecee34fa510147a59f6a5a8ec76b214b10dafb854fd1a1cbaf3ff","observation_id":"5528f362-71d3-4c40-b732-4bd10594960f","resolution":{"observed_at":"2026-05-16T05:21:45.195212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-16T11:33:00.845679Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15369","last_updated":"2025-04-21T18:20:13Z","snapshot_observed_at":"2026-08-20T02:04:33.343781Z","submitted_at":"2025-04-21T18:20:13Z","title":"Solving New Tasks by Adapting Internet Video Knowledge","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:33:00.845679Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2504.15369"},"observation_digest":"sha256:1871c30083e81228afe928a31a25e83a57206dfdfce19b6a1d3a122b33700a24","observation_id":"51c8893f-8572-4192-a5b0-6a67f6f4ca40","resolution":{"observed_at":"2026-08-16T11:33:00.845679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-16T05:18:56.542808Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-19T20:36:18.684533Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:18:56.542808Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2504.20995"},"observation_digest":"sha256:676d030e5a6a616176cd2df866957990cacc325b98bb9ffd16ab1a0191e81259","observation_id":"261fc9fe-99cd-42c1-8ec3-988d4281aac4","resolution":{"observed_at":"2026-08-16T05:18:56.542808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-07T13:51:26.746451Z","title":"Liang, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20795","last_updated":"2026-05-29T12:22:36Z","snapshot_observed_at":"2026-08-13T21:51:15.131045Z","submitted_at":"2025-05-27T06:56:14Z","title":"Learning Generalizable Robot Policy with Human Demonstration Video as a Prompt","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:26.746451Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2505.20795"},"observation_digest":"sha256:954de388232af213f7fbd215de7a0cca65949e8ce95eda2719b2a97093c45c71","observation_id":"e02a5c04-bbd2-44e5-b133-2628ce3964b5","resolution":{"observed_at":"2026-08-07T13:51:26.746451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2506.14135","last_updated":"2026-05-22T16:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T02:55:20Z","title":"GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T07:48:33.832017Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2506.14135"},"observation_digest":"sha256:4557eafab148d26c66376cf2fee2a50106c638b9a59bf20aa1d1f0d0bb2c9fa4","observation_id":"669975e1-3c9b-4f9f-aebc-ad7f8e47dfad","resolution":{"observed_at":"2026-05-25T07:50:29.253724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-07T00:25:28.433785Z","title":"Liang, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14198","last_updated":"2025-06-17T05:31:42Z","snapshot_observed_at":"2026-08-13T06:13:03.182338Z","submitted_at":"2025-06-17T05:31:42Z","title":"AMPLIFY: Actionless Motion Priors for Robot Learning from Videos","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:28.433785Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2506.14198"},"observation_digest":"sha256:849b82423bbdc6d1a34d33b137f042cd7ed9656682537b36fbc9e088a4973280","observation_id":"334ba018-0cee-46fd-9851-a627f3f841ff","resolution":{"observed_at":"2026-08-07T00:25:28.433785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2507.00990","last_updated":"2026-05-13T01:35:48Z","snapshot_observed_at":"2026-07-06T21:50:35.488353Z","submitted_at":"2025-07-01T17:39:59Z","title":"Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T06:36:13.144868Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2507.00990"},"observation_digest":"sha256:7418cec88cba7a3257df611e2c2699ec05c6db77a2640a51c71f7e9cfb8a9b9b","observation_id":"696934a0-dcad-425d-89f4-23c0347c66ab","resolution":{"observed_at":"2026-05-19T06:37:07.305473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2507.01099","last_updated":"2026-05-17T19:33:54Z","snapshot_observed_at":"2026-08-15T09:59:21.724087Z","submitted_at":"2025-07-01T18:01:41Z","title":"Geometry-aware 4D Video Generation for Robot Manipulation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T00:12:39.787489Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2507.01099"},"observation_digest":"sha256:c0a10807f4b07f74329ca76b78bfffd0f696ef635e84d2a3296fce5603ec6754","observation_id":"f79772b2-0054-4973-82f3-263257369076","resolution":{"observed_at":"2026-05-22T00:14:27.884033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-15T17:34:16.479752Z","title":"Dreamitate: Real-world visuomotor policy learn- ing via video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11049","last_updated":"2025-08-14T20:19:20Z","snapshot_observed_at":"2026-08-18T19:42:15.884388Z","submitted_at":"2025-08-14T20:19:20Z","title":"GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:34:16.479752Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2508.11049"},"observation_digest":"sha256:e2a7a09b7462fb63feb5a1fb04f369d9dcea43ad3aa05a673bb5c59423e008fb","observation_id":"982eec53-54ac-4390-9dbe-77f9028ebe5b","resolution":{"observed_at":"2026-08-15T17:34:16.479752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-05T13:46:42.190907Z","title":"Liang, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00361","last_updated":"2025-08-30T04:53:32Z","snapshot_observed_at":"2026-08-14T20:37:46.603109Z","submitted_at":"2025-08-30T04:53:32Z","title":"Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:42.190907Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2509.00361"},"observation_digest":"sha256:3a380e6b25f2020609f3795f447e934e97c736c609bffb0868b67e971b031eb8","observation_id":"ec15c64e-e179-40d1-842e-775872f48e36","resolution":{"observed_at":"2026-08-05T13:46:42.190907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:00.142543Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2512.15692"},"observation_digest":"sha256:ab2bb5b2d217b1911f20f26d0ba24d78f24a4c20592ee841df29c65263e253ec","observation_id":"caa28f53-b6f4-4a3e-a39f-a025a7b12aa7","resolution":{"observed_at":"2026-05-15T10:41:00.342113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-08-11T06:04:17.319434Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T21:26:32.048309Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2512.15840"},"observation_digest":"sha256:5781e91c28730117fa4a18d5951d2a508a5505638e1774c576bee0f64c4415bf","observation_id":"64bd6233-9932-4394-b58a-bce55cb9a266","resolution":{"observed_at":"2026-05-16T21:28:33.968348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-03T05:21:36.855439Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02762","last_updated":"2026-07-02T00:32:14Z","snapshot_observed_at":"2026-08-15T13:09:04.466462Z","submitted_at":"2026-02-02T20:13:43Z","title":"On the Sample Efficiency of Inverse Dynamics Models for Semi-Supervised Imitation Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T05:21:36.855439Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2602.02762"},"observation_digest":"sha256:df580155cb88b37816293e5d4fab181f7f42ac4fe0d8de7f5805f8e0d1daf101","observation_id":"6649c285-688d-4903-8454-803e12168c16","resolution":{"observed_at":"2026-08-03T05:21:36.855439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-03T02:45:07.166991Z","title":"Dreamitate: Real-world visuomotor policy learning via video genera- tion.arXiv preprint arXiv:2406.16862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09878","last_updated":"2026-05-26T17:06:15Z","snapshot_observed_at":"2026-08-16T10:59:13.335731Z","submitted_at":"2026-02-10T15:19:17Z","title":"MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T02:45:07.166991Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2602.09878"},"observation_digest":"sha256:efe077f72015f150047131b801db2a48f9bff0d14474a9c2b0ff01b95dd64f26","observation_id":"2450f2a5-996f-4fc8-95f0-5f3313ae8295","resolution":{"observed_at":"2026-08-03T02:45:07.166991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2603.09030","last_updated":"2026-04-06T01:32:12Z","snapshot_observed_at":"2026-08-14T06:15:35.820060Z","submitted_at":"2026-03-09T23:58:07Z","title":"PlayWorld: Learning Robot World Models from Autonomous Play","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T14:05:32.112432Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2603.09030"},"observation_digest":"sha256:a03b97b8c989781a25e99b15235ad69e2a265c222afd93d0bbbc95fb9ac237a4","observation_id":"9d3dcf4d-fad2-41f5-b0d4-a89fdda96f40","resolution":{"observed_at":"2026-05-15T14:05:54.587400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2604.21914","last_updated":"2026-04-23T17:57:13Z","snapshot_observed_at":"2026-08-13T08:34:04.703373Z","submitted_at":"2026-04-23T17:57:13Z","title":"VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T21:18:12.192842Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2604.21914"},"observation_digest":"sha256:4a3d021d5727cec18b437756149739844060ac59d371b65e2620557f07f7dd87","observation_id":"6f6344db-7ba2-4cde-87ca-055415a5aca3","resolution":{"observed_at":"2026-05-11T14:41:15.698372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:b790319f2e3c31e11e5440de7a4acda5a587b0405094eb8e651dd8f239635b0e","observation_id":"a7d0a91d-4bc0-4118-a456-d83e8cd36f80","resolution":{"observed_at":"2026-05-13T05:02:17.885588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2605.28816","last_updated":"2026-05-27T17:59:31Z","snapshot_observed_at":"2026-08-13T23:19:52.582867Z","submitted_at":"2026-05-27T17:59:31Z","title":"Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T13:34:03.020051Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2605.28816"},"observation_digest":"sha256:1d79d5a73c460f64409cb61f937ebb1a99af6ba405bafcf12eb0d5d8b2abb912","observation_id":"a410089f-a6ac-4699-9217-18dee161c133","resolution":{"observed_at":"2026-06-29T13:53:29.072890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2606.04811","last_updated":"2026-06-04T10:52:20Z","snapshot_observed_at":"2026-08-14T14:29:55.726498Z","submitted_at":"2026-06-03T12:35:35Z","title":"Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T06:33:03.192410Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2606.04811"},"observation_digest":"sha256:289f000db5fc4b37e2b0396bb9a1acb78085064bfb5ad9f60c9e1ee19b3e0455","observation_id":"1d208fd3-f883-41fd-866a-b7d63be24ec6","resolution":{"observed_at":"2026-07-02T07:56:47.496904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2606.11187","last_updated":"2026-06-09T17:59:22Z","snapshot_observed_at":"2026-08-17T18:09:59.650602Z","submitted_at":"2026-06-09T17:59:22Z","title":"Next Forcing: Causal World Modeling with Multi-Chunk Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:53.905704Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2606.11187"},"observation_digest":"sha256:8dfd3640bd3772222560db88c14ada81f3a23f1c55f474f17c6a9c472395dd72","observation_id":"642dda2d-4f0b-415b-8500-f0b9a00f36c6","resolution":{"observed_at":"2026-07-03T04:57:38.465704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2606.15032","last_updated":"2026-06-28T03:48:42Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T00:21:21Z","title":"How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T10:31:37.108792Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2606.15032"},"observation_digest":"sha256:d20a92d424eb18a2ceccbfbbb392bbb450a9d0022203fe0a6eea884cf0beed03","observation_id":"dfbb8428-6a15-45cc-95f8-6bce5700922e","resolution":{"observed_at":"2026-06-30T10:34:36.513994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2606.19340","last_updated":"2026-06-19T13:42:23Z","snapshot_observed_at":"2026-08-14T18:46:15.738338Z","submitted_at":"2026-06-17T17:59:56Z","title":"ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T20:49:01.269513Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2606.19340"},"observation_digest":"sha256:e0ff1434c3b5d83e005dd3160b90fd7e187fdf104e5b898b7febf8698333f053","observation_id":"157e930f-ef18-40cb-b0a5-bb97c8a34d6f","resolution":{"observed_at":"2026-07-04T00:59:20.283368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-13T05:52:18.238364Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:034d5f63b1aedde28185884c1cd81c80818debf6e7b191f0719de14ef47e9bde","observation_id":"99f5512c-fe96-42b1-901b-e30795d594d7","resolution":{"observed_at":"2026-07-04T04:09:35.446108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-15T20:23:49.425816Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T11:47:54.951618Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2606.22136"},"observation_digest":"sha256:c3b173e22465e02a1b87788e141a164b525b6719dde8c15de31937ec053918f4","observation_id":"d6719368-3924-4b30-9b62-086d573cc5f4","resolution":{"observed_at":"2026-07-04T08:19:44.723733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2607.06559","last_updated":"2026-07-07T17:58:15Z","snapshot_observed_at":"2026-08-18T08:45:47.925479Z","submitted_at":"2026-07-07T17:58:15Z","title":"RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T02:00:30.551638Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2607.06559"},"observation_digest":"sha256:79da9144d8a919b875d69ea9bb754c37cda440cfb2e0ecc991279b7629681af9","observation_id":"a8320374-7948-4fc0-adbd-e24c6de68087","resolution":{"observed_at":"2026-07-08T02:04:26.255255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-02T00:04:04.293371Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation.arXiv preprint arXiv:2406.16862, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.293371Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:7b53df94c162d79d2491db6c844efa4e160dab59db7510b056d3a07a1d84636b","observation_id":"88dc05cd-c5fc-4fa2-9d21-a6d5acb375d6","resolution":{"observed_at":"2026-08-02T00:04:04.293371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-01T20:30:42.818011Z","title":"Dreamitate: Real-world visuomotor policy learning via video genera- tion.arXiv preprint arXiv:2406.16862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16602","last_updated":"2026-07-21T07:58:44Z","snapshot_observed_at":"2026-08-15T04:15:36.321234Z","submitted_at":"2026-07-18T02:42:27Z","title":"PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:30:42.818011Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2607.16602"},"observation_digest":"sha256:d7f1eca71545a51bea42e81f9d92ba4e0454bc3c971bbb93e3acbc422c1ca5d3","observation_id":"f8351085-71b3-4046-b884-51628f00edf5","resolution":{"observed_at":"2026-08-01T20:30:42.818011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-12T00:40:08.237283Z","title":"2406.16862 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07981","last_updated":"2026-08-08T07:35:10Z","snapshot_observed_at":"2026-08-20T02:39:56.724385Z","submitted_at":"2026-08-08T07:35:10Z","title":"Distilling Physical Priors into Streaming World Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T00:40:08.237283Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2608.07981"},"observation_digest":"sha256:3f899bce0792003e7b84bd79987854a048ed344d339bafb7ddb5639986a0a8e7","observation_id":"8093cdbc-cf45-48df-a281-fa92e6af386d","resolution":{"observed_at":"2026-08-12T00:40:08.237283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16862/citation-record","integrity":"/paper/2406.16862/integrity","json":"/paper/2406.16862/citation-record.json","paper":"/paper/2406.16862"},"outbound":[],"paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T10:36:28.197890Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2406.16862."}