{"as_of":"2026-08-10T14:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b91b9105e04700b6d431429c7f43d941f1b4f850fe89136d96391720bc55879","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:33:35.739372Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T17:11:12.686936Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:35.431058Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"cited_work":{"arxiv_id":"2502.01784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01784","snapshot_observed_at":"2026-07-04T04:09:35.431058Z","title":"Vilp: Imitation learning with latent video planning","venue":null,"work_id":"54ca5be5-9997-49e1-94bb-f1bd542e29cb","year":2025},"citing_paper":{"arxiv_id":"2603.09030","last_updated":"2026-04-06T01:32:12Z","snapshot_observed_at":"2026-07-30T02:16:48.709523Z","submitted_at":"2026-03-09T23:58:07Z","title":"PlayWorld: Learning Robot World Models from Autonomous Play","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-15T14:05:32.112432Z"},"links":{"cited_paper":"/paper/2502.01784","citing_paper":"/paper/2603.09030"},"observation_digest":"sha256:e6f2c13167111f1660178ac45be294f0c2c3df1b7fbf5325e68276ae49d79d23","observation_id":"52e1f458-9af8-4b0d-a2ef-1012ecb2a891","resolution":{"observed_at":"2026-05-15T14:05:54.649824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"cited_work":{"arxiv_id":"2502.01784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01784","snapshot_observed_at":"2026-07-04T04:09:35.431058Z","title":"Vilp: Imitation learning with latent video planning","venue":null,"work_id":"54ca5be5-9997-49e1-94bb-f1bd542e29cb","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2502.01784","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1539565d4d764547ab048d299696d0b2ec4b8fa7589eb1507f83fc4738df4645","observation_id":"c7589c38-ec74-4858-8017-fa64635727ea","resolution":{"observed_at":"2026-05-13T05:07:18.324656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"cited_work":{"arxiv_id":"2502.01784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01784","snapshot_observed_at":"2026-07-04T04:09:35.431058Z","title":"Vilp: Imitation learning with latent video planning","venue":null,"work_id":"54ca5be5-9997-49e1-94bb-f1bd542e29cb","year":2025},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-03T05:46:19.564000Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2502.01784","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:7a5a4af8aeb5dbf75dc24560cfd0bc242392885f6420a477cef04ac733ec4e30","observation_id":"4b322faa-5cfd-46f1-8624-db4beb7da9b8","resolution":{"observed_at":"2026-07-04T04:09:35.433614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01784/citation-record","integrity":"/paper/2502.01784/integrity","json":"/paper/2502.01784/citation-record.json","paper":"/paper/2502.01784"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.523816Z","title":"Video generation models as world simulators,","venue":null,"work_id":"70fb3413-2270-48bf-a573-9a4c8c8fc4ad","year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.336706Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:ae2219e99123ffc64413b50378df2e0c95c06c2510070e2508a5cd41e2aa727b","observation_id":"fa5c594c-8cc9-4309-a6bf-3baa5879499d","resolution":{"observed_at":"2026-08-09T14:33:36.529029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-08-09T12:57:58.196865Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-08-09T14:33:35.346360Z","title":"Video language planning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.346360Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:66b1d3da0b29acf29d488f707f8a765f83e1266c51e16768756c1d1f46a6391d","observation_id":"23afedc3-2ba1-4404-be86-d976b7796541","resolution":{"observed_at":"2026-08-09T14:33:35.346360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.507024Z","title":"Learning universal policies via text-guided video generation,","venue":null,"work_id":"dbf80fba-f49d-44e3-acce-1f48cd3a8c1f","year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.359153Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:cec7c8ec8f9840424091894a5b96f3fa07ad52b8fb73dc9f0c90494642bbbc13","observation_id":"e1c4dc65-4151-4dc5-92cd-27db736df7d9","resolution":{"observed_at":"2026-08-09T14:33:36.512412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-05T14:38:36.869054Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-08-09T14:33:35.371228Z","title":"Learn- ing to Act from Actionless Video through Dense Correspondences,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.371228Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:046216632b7d475b713497e49672e003c324d77abefafdeedf53ce7ce6388094","observation_id":"0584c9cb-3bf1-4f6a-9b04-d7ed9cc2ae5c","resolution":{"observed_at":"2026-08-09T14:33:35.371228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.489835Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer,","venue":null,"work_id":"3afe7a89-2e36-4707-b4a5-f94c97d7fec2","year":2022},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.376773Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:551dff7c1f6ac230d1b5111d6632d28e5ed86af258b52ad74850efec77f45fea","observation_id":"d71e95cf-fa46-4398-b0d9-f690ded1ef47","resolution":{"observed_at":"2026-08-09T14:33:36.494655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.474647Z","title":"Magvit: Masked gen- erative video transformer,","venue":null,"work_id":"9569c1e5-e31f-4729-a068-cdbbe63a2dd4","year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.382311Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:d77df80f62263b8aa91a57a2ae40ad813f654b93fc5a26bc6e77f7ec82702948","observation_id":"54d1402c-74cb-48c8-8af7-d62980b3bd7b","resolution":{"observed_at":"2026-08-09T14:33:36.479189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-09T14:33:35.387369Z","title":"Videogpt: Video generation using vq-vae and transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.387369Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:731c518180037515774d87ec9173edba0fc19e290d5783efb0ce09fdb12061f0","observation_id":"797f45c7-f47f-4e5a-8721-033e956589f9","resolution":{"observed_at":"2026-08-09T14:33:35.387369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.459303Z","title":"Implicit behavioral cloning,","venue":null,"work_id":"10749984-07e0-4f4e-a95b-442933cb6b26","year":2022},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.392649Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:d94dfee876728ed5e0425cdb04807b05ac3459d3fa26f811a47c26b1733b819e","observation_id":"cd7a2c7c-49e7-4d9e-8cee-2cd26d4ee6b9","resolution":{"observed_at":"2026-08-09T14:33:36.463874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.397699Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.397699Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:21ea6c416a3f8b365977635ad655093e39ee969ea51177f53efaadfcaa56b814","observation_id":"a3ebb6dd-a696-4de4-9c6b-33bc8ab89deb","resolution":{"observed_at":"2026-08-09T14:33:35.397699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03181","last_updated":"2024-06-28T04:15:33Z","snapshot_observed_at":"2026-08-04T18:59:25.456993Z","submitted_at":"2024-03-05T18:19:29Z","title":"Behavior Generation with Latent Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03181","snapshot_observed_at":"2026-08-09T14:33:35.402594Z","title":"Behavior generation with latent actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.402594Z"},"links":{"cited_paper":"/paper/2403.03181","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:2559c31fecdca399f33b8ded80ef9192ab61300e029df7b8050742e348c3dd7f","observation_id":"6e2ca90d-2d2c-4d02-88ec-c233cd5635e0","resolution":{"observed_at":"2026-08-09T14:33:35.402594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04380","last_updated":"2024-08-21T15:54:54Z","snapshot_observed_at":"2026-08-07T06:42:07.417838Z","submitted_at":"2024-08-08T11:34:31Z","title":"Deep Generative Models in Robotics: A Survey on Learning from Multimodal Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04380","snapshot_observed_at":"2026-08-09T14:33:35.408344Z","title":"Deep generative models in robotics: A survey on learning from multimodal demonstrations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.408344Z"},"links":{"cited_paper":"/paper/2408.04380","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:067b9d56de43340bb4dde5369e22d27d965526224216294085a004beb0ecb4e2","observation_id":"4a165528-6cae-4c39-854a-cdc273c2b799","resolution":{"observed_at":"2026-08-09T14:33:35.408344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-09T14:33:35.413760Z","title":"Learning interactive real-world simulators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.413760Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:398967f48b846596cabce55203896c3c4eae2cab6b5c32bc87bb39250381283c","observation_id":"b89a3466-1abf-4382-85f3-948b3e1ac97b","resolution":{"observed_at":"2026-08-09T14:33:35.413760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14897","last_updated":"2026-04-25T05:18:57Z","snapshot_observed_at":"2026-07-06T15:08:15.836938Z","submitted_at":"2023-03-27T03:12:24Z","title":"Seer: Language Instructed Video Prediction with Latent Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14897","snapshot_observed_at":"2026-08-09T14:33:35.418444Z","title":"Seer: Language in- structed video prediction with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.418444Z"},"links":{"cited_paper":"/paper/2303.14897","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:b8d633f416adea05f101410e0a2663f1c589367923001e3c9f3ce1e9daa4d9c8","observation_id":"b2d81b33-2cde-45d8-a707-6754a60c571b","resolution":{"observed_at":"2026-08-09T14:33:35.418444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-04T07:35:11.914654Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-09T14:33:35.423656Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.423656Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:3afd2ab9e44728aeba411235dd10e79d809e22d7ef8c4040bc2a8a594a14df2b","observation_id":"44dfe1b6-7bd1-4773-b452-2a379feef768","resolution":{"observed_at":"2026-08-09T14:33:35.423656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.429786Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.429786Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:22a331410837446e89793a40f682c710a954695f87997a626253baac092f0440","observation_id":"2c508030-a040-4ca1-a5ae-3cf5af5276a0","resolution":{"observed_at":"2026-08-09T14:33:35.429786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.434076Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.434076Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:69e7653ff8a379e5f759add3390ad80fb3549590246ab9aad85672c9df7fc6ae","observation_id":"dc6828e7-e6d0-466d-8a4e-0e24d5f1fd2d","resolution":{"observed_at":"2026-08-09T14:33:35.434076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-09T14:33:35.438504Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.438504Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:f226ef9a4a1aa15d1bdb0562f9170974ad176e98ef8d83c43d3a2034382cdf50","observation_id":"80b12ecf-7237-4094-9663-e125e9417a6d","resolution":{"observed_at":"2026-08-09T14:33:35.438504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.458151Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.458151Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:89c511ad53f8f0371b04369a1632fbe099329dba28aba75717ce9dba8fef6ea3","observation_id":"0a28d709-b15a-444f-89ce-c357acb81ffe","resolution":{"observed_at":"2026-08-09T14:33:35.458151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.402065Z","title":"Taming transformers for high-resolution image synthesis,","venue":null,"work_id":"4fdfa61f-e830-4318-9bb7-a54d893b53b0","year":2021},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.481896Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:f95ffb8554cc7881474a545599d9ad0d9658631814a4a5efbc4db6c3ccf8c396","observation_id":"665b4ac8-c924-4088-b6f6-365c9ddb3609","resolution":{"observed_at":"2026-08-09T14:33:36.406886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.518834Z","title":"The unreasonable effectiveness of deep features as a perceptual metric,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.518834Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:baa456b352f0fb57e5e53050bcd85bddfb247fb130b2c5923ec8ce5026118827","observation_id":"155d5fbd-cbd3-4f0e-9967-f5dfabf9b149","resolution":{"observed_at":"2026-08-09T14:33:35.518834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-09T14:33:35.558463Z","title":"Vector-quantized image modeling with improved vqgan,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.558463Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:51023c7fc8af2d643205e5faf6d8ab35bb430a11027f7720c2677d7554860958","observation_id":"64085b13-fe96-4d21-b28f-cebd8e2290e6","resolution":{"observed_at":"2026-08-09T14:33:35.558463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.609801Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.609801Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:27548d0895a2656edb9fbafcac494b58100f0a3d0d02185fafc73fb17fbc0411","observation_id":"df488b6c-27d8-4c8e-bf08-24ede594b838","resolution":{"observed_at":"2026-08-09T14:33:35.609801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.234773Z","title":"U-net: Convolutional net- works for biomedical image segmentation,","venue":null,"work_id":"6e32ef03-82cf-47b3-8223-e8d4453d4d67","year":2015},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.678962Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:984d26e2c9d512f1cce90ae84df1ffc4b7702c85762fbd13aa5a0f7da475caf3","observation_id":"9225be54-1cc9-4abb-a732-e9896aad3700","resolution":{"observed_at":"2026-08-09T14:33:36.302575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.692521Z","title":"Perceiver: General perception with iterative attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.692521Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:5119510deaf7e03a29e61892c7cb3fa04610212bbdd60c4968452fc7ab17e7d5","observation_id":"cecb2177-dac2-456f-86a1-018122cb27c7","resolution":{"observed_at":"2026-08-09T14:33:35.692521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:35.706785Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.706785Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:3a8d21beede7dee54cf9efc18a178f8e7c9d1f9678dd53173dbec66da27b5134","observation_id":"53e2faad-17a1-4d25-9681-adcd61cdce30","resolution":{"observed_at":"2026-08-09T14:33:35.706785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06481","last_updated":"2025-04-01T18:26:36Z","snapshot_observed_at":"2026-07-06T18:59:51.988540Z","submitted_at":"2024-08-12T20:29:09Z","title":"UniT: Data Efficient Tactile Representation with Generalization to Unseen Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06481","snapshot_observed_at":"2026-08-09T14:33:35.720168Z","title":"UniT: Unified tactile representation for robot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.720168Z"},"links":{"cited_paper":"/paper/2408.06481","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:4788f819f8b6bd8daa609789989ec9b397b6354db00f2372b6e8c5f91f23630c","observation_id":"4355e585-f637-4316-a21b-be1bc2690392","resolution":{"observed_at":"2026-08-09T14:33:35.720168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17500","last_updated":"2024-10-23T18:04:54Z","snapshot_observed_at":"2026-07-06T17:22:49.561301Z","submitted_at":"2024-01-30T23:18:35Z","title":"LeTO: Learning Constrained Visuomotor Policy with Differentiable Trajectory Optimization","version":3},"cited_work":{"arxiv_id":"2401.17500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.17500","snapshot_observed_at":"2026-08-09T14:33:35.778553Z","title":"LeTO: Learning Constrained Visuomotor Policy with Differentiable Trajectory Optimization","venue":"cs.RO","work_id":"10e6ad46-b407-4539-bfb3-993483938906","year":2024},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.724897Z"},"links":{"cited_paper":"/paper/2401.17500","citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:104fe94b4ce43a248013b5a8ff09997895fe3bbf170cf5a2a26971cbb9c1520b","observation_id":"23aa9c62-6640-4797-960e-f87a978be05b","resolution":{"observed_at":"2026-08-09T14:33:35.787103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.138193Z","title":"Transporter networks: Rearranging the visual world for robotic manipulation,","venue":null,"work_id":"e3725ba9-6e2f-48b8-bfce-827ee5914738","year":2021},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.730301Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:134b1dfffa793ac008a330cb4a7625118cc05ad666bdda36e2717c04ab4fce7a","observation_id":"81bcab55-f336-44ea-8854-f472cd504e1d","resolution":{"observed_at":"2026-08-09T14:33:36.157571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.122398Z","title":"What matters in learning from offline human demonstrations for robot manipulation,","venue":null,"work_id":"36b971fd-a39b-4e60-8a59-4bae779aa8c2","year":2022},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.735210Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:53cc3963f6fde858c4d6d2779edb06cbfd06ae822d7f5a6cfdd93f53893a1185","observation_id":"87fdf679-d883-4a6e-b197-aa685b006159","resolution":{"observed_at":"2026-08-09T14:33:36.127603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:33:36.104825Z","title":"Iterative Residual Policy: for goal-conditioned dynamic manipulation of de- formable objects,","venue":null,"work_id":"004793ed-1dbd-4287-923b-d62b11a6cc15","year":2022},"citing_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T14:33:35.739372Z"},"links":{"citing_paper":"/paper/2502.01784"},"observation_digest":"sha256:51f04720074f7b21ac1ab50efe096ec49c6f65b88351990cf0dfaeaeea671cea","observation_id":"9e17591c-a015-4990-9338-d9538d3d4731","resolution":{"observed_at":"2026-08-09T14:33:36.110959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T16:26:38.058796Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 3 inbound Pith citation observations for arXiv:2502.01784."}