{"as_of":"2026-08-09T04:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1efeb40b05342fc850f339b6efe5d89f8833cb7baf21c50d2b4a272aa26180d1","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:10:13.474149Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:26:40.586348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:16:58.078690Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-08-05T15:26:40.586348Z","title":"Zhang, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19958","last_updated":"2025-08-28T10:13:01Z","snapshot_observed_at":"2026-08-06T11:55:27.946631Z","submitted_at":"2025-08-27T15:12:03Z","title":"Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:26:40.586348Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2508.19958"},"observation_digest":"sha256:101620b5980b5126d2e8d1ee88459019cf78fd5b62142c7a9f7ae39ec863c149","observation_id":"087655ed-d631-4ecc-90a3-cb09436d4293","resolution":{"observed_at":"2026-08-05T15:26:40.586348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":"2502.09268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-07-02T13:16:58.078690Z","title":"arXiv:2502.09268 [cs.RO] https://arxiv.org/abs/2502.09268","venue":null,"work_id":"f2fb2995-6294-459c-892d-49eae5aadc88","year":2025},"citing_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:08.970164Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2604.08168"},"observation_digest":"sha256:a9457b898fe30c8e9df4a2a493f8d65d9a778d7250d6ca1daf7c153dc84356e7","observation_id":"a1b77edf-4751-4032-837f-11d91ee29833","resolution":{"observed_at":"2026-05-11T07:25:59.007338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-07-13T00:03:53.609175Z","title":"Gevrm: Goal-expressive video generation model for robust visual manipulation.arXiv preprint arXiv:2502.09268, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08169","last_updated":"2026-07-02T01:38:10Z","snapshot_observed_at":"2026-08-07T08:51:57.871195Z","submitted_at":"2026-04-09T12:28:22Z","title":"Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T00:03:53.609175Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2604.08169"},"observation_digest":"sha256:b56223594f3e0dd7fc1fe20c41f3de9bb6e27369072602d529fcb1b099f63dc1","observation_id":"dab481a5-713d-4ec9-b353-a4d72be0babf","resolution":{"observed_at":"2026-07-13T00:03:53.609175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":"2502.09268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-07-02T13:16:58.078690Z","title":"arXiv:2502.09268 [cs.RO] https://arxiv.org/abs/2502.09268","venue":null,"work_id":"f2fb2995-6294-459c-892d-49eae5aadc88","year":2025},"citing_paper":{"arxiv_id":"2604.10055","last_updated":"2026-04-14T02:34:59Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T06:37:47Z","title":"STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:33:16.554905Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2604.10055"},"observation_digest":"sha256:8a8a1ff97a1e0b0915705a1fcce7d10ee9443f5502d342ca27076452a7c0611f","observation_id":"e74777fd-9995-46df-84c4-9d70a46718ba","resolution":{"observed_at":"2026-05-11T08:41:00.027103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":"2502.09268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-07-02T13:16:58.078690Z","title":"arXiv:2502.09268 [cs.RO] https://arxiv.org/abs/2502.09268","venue":null,"work_id":"f2fb2995-6294-459c-892d-49eae5aadc88","year":2025},"citing_paper":{"arxiv_id":"2604.14732","last_updated":"2026-04-19T07:53:54Z","snapshot_observed_at":"2026-07-06T23:02:27.141640Z","submitted_at":"2026-04-16T07:46:05Z","title":"World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T11:25:57.218073Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2604.14732"},"observation_digest":"sha256:9e0f56c84c4cd1a9f7d07e3bdd1d787c5227be93d467dbca89d75d6e596b79d7","observation_id":"324a9723-1a61-4abb-b640-8aeace9bd246","resolution":{"observed_at":"2026-05-10T11:30:19.071025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":"2502.09268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-07-02T13:16:58.078690Z","title":"arXiv:2502.09268 [cs.RO] https://arxiv.org/abs/2502.09268","venue":null,"work_id":"f2fb2995-6294-459c-892d-49eae5aadc88","year":2025},"citing_paper":{"arxiv_id":"2607.01222","last_updated":"2026-07-01T17:56:39Z","snapshot_observed_at":"2026-08-04T02:18:09.786163Z","submitted_at":"2026-07-01T17:56:39Z","title":"Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-02T13:16:16.676244Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2607.01222"},"observation_digest":"sha256:d48cb28bee90830a478a54a9a638f997e547fa16e96913a7b998dfc2716af24c","observation_id":"1693a345-199e-4622-a697-bec1e2ae1258","resolution":{"observed_at":"2026-07-02T13:16:58.080059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-08-05T14:32:58.543303Z","title":"Gevrm: Goal-expressive video generation model for robust visual manipulation.arXiv preprint arXiv:2502.09268, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.543303Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:512b55916a9673d1cdf0dcd5627a7c1d8452cbb909313baa19c4b20590651dfe","observation_id":"8a465ad2-d513-480b-ab07-c2d1cc5d1253","resolution":{"observed_at":"2026-08-05T14:32:58.543303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09268/citation-record","integrity":"/paper/2502.09268/integrity","json":"/paper/2502.09268/citation-record.json","paper":"/paper/2502.09268"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.949088Z","title":"MCIL trains a single goal-conditioned policy by mapping various contexts, such as target images, task IDs, and natural language, into a shared latent goal space","venue":null,"work_id":"a0d06e82-b53e-4199-8c7f-31a51d82f3ea","year":2020},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.439006Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:d3343927078c4066ac701b57155a4458f7e247c754eeb38dea4b2ec1f97ead09","observation_id":"77857f45-ef83-4b28-9f0c-327c15996f64","resolution":{"observed_at":"2026-08-07T22:10:13.954329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.933703Z","title":"MdetrLC uses text query mod- ulation to detect objects within images and demonstrates strong performance in tasks like visual question answering and phrase localization","venue":null,"work_id":"9d6511f6-f3cd-4bdf-96b9-971404157c05","year":2021},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.442947Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:97026e5c8a94ddef8fd69023f33d08c81b3f5e89ab9f2fa09bbd7c0b446c3cc7","observation_id":"0907ae65-e66b-4c30-b0bd-77c67ab2996c","resolution":{"observed_at":"2026-08-07T22:10:13.938766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.919462Z","title":null,"venue":null,"work_id":"53515fd9-d7c9-4192-8c01-18f52b0aaa18","year":2019},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.446944Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:50190d75759e9d67e3f9166e743d027726440775ba1f14d7f337678dde88c7f1","observation_id":"02ca56fb-f985-4f80-af86-2c27cf2bb354","resolution":{"observed_at":"2026-08-07T22:10:13.923892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.329891Z","title":"Multi-column deep neural networks for image classification","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.329891Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:d04b09cd739a7167c0fe240aa018d5b69f4b8fad7fc79e91f6a0825e6b5f2c85","observation_id":"0885ae0c-9d06-4c79-81c9-32b1fec08f36","resolution":{"observed_at":"2026-08-07T22:10:13.329891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14457","last_updated":"2025-02-04T13:33:56Z","snapshot_observed_at":"2026-08-08T16:01:45.516788Z","submitted_at":"2023-12-22T06:15:03Z","title":"QUAR-VLA: Vision-Language-Action Model for Quadruped Robots","version":6},"cited_work":{"arxiv_id":"2312.14457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.14457","snapshot_observed_at":"2026-08-07T22:10:13.730673Z","title":"QUAR-VLA: Vision-Language-Action Model for Quadruped Robots","venue":"cs.RO","work_id":"de6e891b-a3fc-4599-bf23-0732220e1f34","year":2023},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.340871Z"},"links":{"cited_paper":"/paper/2312.14457","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:bc910f627273ce0f2d91578cda62ad63aa5e9d8974a1464136c6ad571edfbd1b","observation_id":"f1fd9f1e-c76a-437e-8e54-b594bbd20827","resolution":{"observed_at":"2026-08-07T22:10:13.737757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:14.010418Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":"f3e75cb3-1309-4e4c-b6a4-ceef583b3b1c","year":2025},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.346506Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:e14c907655fa899f9c969268df96b0d33cd7c9338e3cc1960e9f0eba6efcaaba","observation_id":"2516f0e0-03cd-4a76-abb8-cbd4490c7864","resolution":{"observed_at":"2026-08-07T22:10:14.015370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T22:10:13.356571Z","title":"Aishwarya Kamath, Mannat Singh, Yann LeCun, Gabriel Synnaeve, Ishan Misra, and Nicolas Car- ion","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.356571Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:a851eba8f771cee3cc0d5fb21061d4455694085e0992d9395a18cac5cf642674","observation_id":"6fc987c4-dec2-4ff9-b155-f9ee0bbd2348","resolution":{"observed_at":"2026-08-07T22:10:13.356571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-05T14:38:36.869054Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-08-07T22:10:13.371215Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.371215Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:b05ca382b30616591c538bf31a989ad714cb5cec109c70dc65f91bd44e84fa85","observation_id":"b85776dd-69b6-4ec7-b660-b452a7b2d027","resolution":{"observed_at":"2026-08-07T22:10:13.371215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T22:10:13.376171Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.376171Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:9b2aaa9aff73fe41788cfa88d9f0abf48817fd4bde476de12f59870ad7ccd7d8","observation_id":"70c4fcec-1f1e-4baa-af95-4b606682321e","resolution":{"observed_at":"2026-08-07T22:10:13.376171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T22:10:13.381137Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.381137Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:f61b3b869238e57bd11f2aff17a5537d90a1e56b26f0b9cd07293774d5baf0ea","observation_id":"c690418d-fc6f-48c7-9c61-2b72c2a73ad0","resolution":{"observed_at":"2026-08-07T22:10:13.381137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-08-05T04:07:39.705365Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-08-07T22:10:13.386053Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.386053Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:b2fc2b3d9de62e0827532ef05c444724de32523d2edd5338d297760631c2c3ee","observation_id":"4cdcda9e-d353-4bc5-9939-bcd46c632d83","resolution":{"observed_at":"2026-08-07T22:10:13.386053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.995208Z","title":"What matters in language conditioned robotic imitation learning over unstructured data","venue":null,"work_id":"461cd028-fdab-4db3-9e89-f4249034b2a3","year":2025},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.391135Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:ee1bed1d39f51800bde6132a166ee7575ac986f9e91dce7a7816ea3e6d3c8f2f","observation_id":"7bfa824a-96b0-471d-9955-e41c25ebed75","resolution":{"observed_at":"2026-08-07T22:10:14.000161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-08-08T23:22:00.655876Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-07T22:10:13.406375Z","title":"Ul2: Unifying language learning paradigms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.406375Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:419f92a34a9af4566b67aad66229f406513198b36b54703f370b979c9acb8ce5","observation_id":"3266e597-4108-4216-911f-0a1331347839","resolution":{"observed_at":"2026-08-07T22:10:13.406375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-07T22:10:13.411250Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.411250Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:45ac4b059451853a5ea40576c5e2bbf2fff100b8131ccda26a774aef8b3e33ce","observation_id":"23772e90-b9b7-47b2-a94c-cbe4ca309cae","resolution":{"observed_at":"2026-08-07T22:10:13.411250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T22:10:13.416313Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.416313Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:b65083ca3ac4522f147a82ef24977665bc2fee84f0b5120322dad2936323855d","observation_id":"0a303011-a4a4-4ae6-ac89-690b7b35470c","resolution":{"observed_at":"2026-08-07T22:10:13.416313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-07T22:10:13.421325Z","title":"Language model beats diffusion– tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.421325Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:dd526f8f28b498c21e3564c05dd0782d842b590f9b3e3a5c778abb30ba75d50c","observation_id":"ae8ed9be-3096-4d47-9f3a-a247369a29f0","resolution":{"observed_at":"2026-08-07T22:10:13.421325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03346","last_updated":"2025-06-10T04:54:06Z","snapshot_observed_at":"2026-07-06T15:38:58.578200Z","submitted_at":"2023-06-06T01:36:56Z","title":"Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03346","snapshot_observed_at":"2026-08-07T22:10:13.425586Z","title":"Stabilizing contrastive rl: Techniques for robotic goal reaching from offline data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.425586Z"},"links":{"cited_paper":"/paper/2306.03346","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:f633f5154f783ae78911afee309214d907b755fa784614efc399d343ee3369f6","observation_id":"8fd42b4e-9e4f-410f-954d-d9f8695a8d1e","resolution":{"observed_at":"2026-08-07T22:10:13.425586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-02T11:29:41.147175Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-07T22:10:13.429917Z","title":"Siyuan Zhou, Yilun Du, Jiaben Chen, Yandong Li, Dit-Yan Yeung, and Chuang Gan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.429917Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:17b8e226864a632b8f6d748291fa71ab981261e7d0c81f7669111d209de6fe61","observation_id":"a5b8a444-4ad4-40c5-a1e2-e671fe3d0028","resolution":{"observed_at":"2026-08-07T22:10:13.429917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.964991Z","title":"CALVIN Datasets","venue":null,"work_id":"7d5a4406-d33c-4c0c-8724-316f8b7ba69d","year":2025},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.434172Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:16d89848cbf007ef979467b72f5b47befcd33d6eb08c41c1f815c2ca727390e5","observation_id":"f38028bd-bebc-4c38-bf91-1ff54971880d","resolution":{"observed_at":"2026-08-07T22:10:13.969688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.903578Z","title":null,"venue":null,"work_id":"0e45b7f3-31ec-4453-9d7a-d877ac7c3117","year":2023},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.451086Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:3e44f877d726bec63fc7b831325c40d7bdda448227a7c3ff6e261689f84ef807","observation_id":"916af6bd-da65-4567-99fb-987036e90c28","resolution":{"observed_at":"2026-08-07T22:10:13.908798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.888367Z","title":"This approach decomposes tasks into high-level planning and low-level action generation, improving task execution in com- plex scenarios","venue":null,"work_id":"3a730f0a-326b-47f8-86eb-79f339088a1f","year":2024},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.455199Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:4dcbd8e4aea6043d029e3435398616433581583eae4183260e4b949f6c158ee2","observation_id":"61136e6b-baca-498c-afb1-d98e0e5d757c","resolution":{"observed_at":"2026-08-07T22:10:13.892714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.873554Z","title":"SuSIE integrates a large-scale internet visual corpus during sub-goal generation and achieves these generated sub-goals through a low-level goal-oriented policy","venue":null,"work_id":"6bbf08cc-27fd-4cd2-aabc-85f9a643cc78","year":2023},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.459443Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:cb15073fe835d6bd309eee76652a660addb753979b32b4f4a478d6ad00e88dac","observation_id":"7d8850be-c30c-42d4-838c-19eb376365b5","resolution":{"observed_at":"2026-08-07T22:10:13.878128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.857464Z","title":"time [s] 1 2 3 4 5 A vg","venue":null,"work_id":"fac1bd53-897c-4494-8489-25c93261d1f7","year":2025},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.464439Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:6767a55663773f8cbdeacad895bca088b406d3e03b61b0d681bdefe06a3673c4","observation_id":"b1f26547-a910-458a-903e-73f8612dae7b","resolution":{"observed_at":"2026-08-07T22:10:13.862349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.826061Z","title":null,"venue":null,"work_id":"a49469b0-7294-4c31-aafc-16eb36a071bd","year":2000},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.474149Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:4e0108361b97626c7ae5464867b1f6cd865f8fc53ced4fe2adbd3f9e90abc76c","observation_id":"1447bb0c-990c-49be-a7c6-a4b93879d94f","resolution":{"observed_at":"2026-08-07T22:10:13.831243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.841857Z","title":null,"venue":null,"work_id":"415aca9c-f3c0-47ce-94f9-f207e4763e5f","year":2025},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.469084Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:d08f2f47c77791b4e208d8e282ec18bb718dd9d860487ca63c8a5d6df68b4f60","observation_id":"79826b32-2b58-4ea7-bbf4-a72f253c24f5","resolution":{"observed_at":"2026-08-07T22:10:13.846647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-08-07T22:37:17.355946Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-07T22:10:13.396381Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.396381Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:ebe23217b6ff922adb00828166efb9c41ffb32fa9082020c9927efca7855c673","observation_id":"f9a55c44-7a6c-4c07-846f-047ab736febd","resolution":{"observed_at":"2026-08-07T22:10:13.396381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T22:10:13.366340Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.366340Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:aede26b610ccd634701223808faa468fd68f4018b614729a4d0e55909c89c2ab","observation_id":"6fe32628-a306-4271-8b7e-b46bcac190a1","resolution":{"observed_at":"2026-08-07T22:10:13.366340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:10:13.979911Z","title":"Learn- ing to augment synthetic images for sim2real policy transfer","venue":null,"work_id":"bf5ec69f-2615-4fb9-9be1-ba7f09954a71","year":2019},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.401709Z"},"links":{"citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:ad016cad7de20ff0bdd9192d4fabb55260c94c042279e49726859bbdf13c79c9","observation_id":"cbe8c123-ccae-4043-be10-6e7100ab296b","resolution":{"observed_at":"2026-08-07T22:10:13.984953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1102.0183","last_updated":"2011-02-01T15:34:43Z","snapshot_observed_at":"2026-07-06T02:22:51.555249Z","submitted_at":"2011-02-01T15:34:43Z","title":"High-Performance Neural Networks for Visual Object Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1102.0183","snapshot_observed_at":"2026-08-07T22:10:13.335182Z","title":"High- performance neural networks for visual object classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.335182Z"},"links":{"cited_paper":"/paper/1102.0183","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:1c905cc8733629de250bf36dde3942c612e9d5dbe092fcb573484891f48cb7da","observation_id":"1c6bc823-d6bb-4212-a499-aa72abd1804c","resolution":{"observed_at":"2026-08-07T22:10:13.335182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-07T22:10:13.324245Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.324245Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:ebff24f8e825ebfb0bd23f7a9e2072b0a84c2c62248eae11490b8180a9383a09","observation_id":"c4e6c8f0-c41b-44da-a0b2-5ef64e776293","resolution":{"observed_at":"2026-08-07T22:10:13.324245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-07T22:10:13.361758Z","title":"How far is video generation from world model: A physical law perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.361758Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:3ecac84edaecf7cdb8a898908a0859cc54b0cff161f7d49925dca977867af64a","observation_id":"096025b6-c5eb-4783-af4b-cc2115be1cba","resolution":{"observed_at":"2026-08-07T22:10:13.361758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-07T22:10:13.306435Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.306435Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:bfae7b2a0575df8f9ece308913a7ccf0cf0cc981a6618bcde116d2f9058b0255","observation_id":"34b33d7c-b41a-42bc-8e51-54355e420024","resolution":{"observed_at":"2026-08-07T22:10:13.306435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T22:10:13.313181Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.313181Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:8d4c8023c1657c277292044370f50b639b506a641cab4ef1f072a059e689f16e","observation_id":"392c608a-c55d-489c-9f06-83501e476f14","resolution":{"observed_at":"2026-08-07T22:10:13.313181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09016","last_updated":"2024-10-16T08:38:07Z","snapshot_observed_at":"2026-07-06T19:15:08.847236Z","submitted_at":"2024-09-13T17:45:07Z","title":"Closed-Loop Visuomotor Control with Generative Expectation for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09016","snapshot_observed_at":"2026-08-07T22:10:13.318398Z","title":"Qingwen Bu, Jia Zeng, Li Chen, Yanchao Yang, Guyue Zhou, Junchi Yan, Ping Luo, Heming Cui, Yi Ma, and Hongyang Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.318398Z"},"links":{"cited_paper":"/paper/2409.09016","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:861d613d997dc3bb4c9eff5c8fe7b9c6154cbeed52709d19d4b33dcf950c87aa","observation_id":"1ea1bcbc-4357-45ea-923b-c6f37ff14cc0","resolution":{"observed_at":"2026-08-07T22:10:13.318398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 7 inbound Pith citation observations for arXiv:2502.09268."}