{"as_of":"2026-08-08T23:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b3f83e6db149219321c5afcc2dce69ca4ec83707fa34fde9307064641f83a0f","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:11:17.990150Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06332/citation-record","integrity":"/paper/2608.06332/integrity","json":"/paper/2608.06332/citation-record.json","paper":"/paper/2608.06332"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T05:11:17.594402Z","title":"π 0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.594402Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:feffd828493d52a64fadbde80d3a43e799c39ab5a26b0858f80a7d9a6aa25e8c","observation_id":"b3c1590b-7162-40e3-a853-2548c2fbc433","resolution":{"observed_at":"2026-08-07T05:11:17.594402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-07T05:11:17.604459Z","title":"π ∗ 0.6: A vla that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.604459Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:cdfb087f0c0ebdacdb60cd332b4d60fb3bd92ea645691f42723a7b83744b1dba","observation_id":"f3a19400-cf9c-4586-b656-e8548313dd0c","resolution":{"observed_at":"2026-08-07T05:11:17.604459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-07T05:11:17.610357Z","title":"π 0.7: A steer- able generalist robotic foundation model with emergent capabilities,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.610357Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7e438e2840af0bb9ba2907c7a33690ad1d71f43850a52a1a9c0fd797e15c313f","observation_id":"5fd2d64c-35f1-4c47-8f22-cc542e4bbec8","resolution":{"observed_at":"2026-08-07T05:11:17.610357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T05:11:17.616274Z","title":"π 0.5: A vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.616274Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9bb090fb918a8af2df42ebb33df087dd2f894505ad47f4ec37260cfd87477fdd","observation_id":"a51a16cb-a0d6-483a-8409-c898457337e3","resolution":{"observed_at":"2026-08-07T05:11:17.616274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T05:11:17.622778Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.622778Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:73040ef35ac8aafb4d0306675489e0cdb1d71f20f635972f8d5c558d02d6602a","observation_id":"6bfad3f2-9f34-4e94-ab6f-f6f87bbcd5a2","resolution":{"observed_at":"2026-08-07T05:11:17.622778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T05:11:17.628322Z","title":"Gemini robotics: Bringing ai into the physical world,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.628322Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:49466abadc08de76d862f403e7e0aac7becbc182b1fe4b7d25dc0e8083eb2eac","observation_id":"7763ba59-9128-4887-b808-8d049e92a5ef","resolution":{"observed_at":"2026-08-07T05:11:17.628322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-08-07T05:11:17.634768Z","title":"Posevla: Universal pose pretraining for generalizable vision- language-action policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.634768Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:db765db6428e067630cf54527721ca7282dc797442e356df3069bf5581405849","observation_id":"debb4867-1ec5-4d65-ac42-eeedc4ffc602","resolution":{"observed_at":"2026-08-07T05:11:17.634768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.117198Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge,","venue":null,"work_id":"5c9e2339-b993-46f5-9bdd-d73feb0d8e4d","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.639789Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:98c79a70ab128e9e4c25e5587cbbb9b0087e302bddac8705a084a8cb190eac1c","observation_id":"474621e8-ffaf-44d8-88e0-404d9d07dc06","resolution":{"observed_at":"2026-08-07T05:11:20.124763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-07T05:11:17.644815Z","title":"Causal world modeling for robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.644815Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:8ef769b0fb0cc8f23e2f8cb7132c9156c789f4d36c48eb90fd24a39c4e7cce10","observation_id":"3904f0db-495c-4051-9593-514b82273844","resolution":{"observed_at":"2026-08-07T05:11:17.644815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-07T05:11:17.651486Z","title":"World action models are zero- shot policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.651486Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e94356a75e4e99c53e43501d05717004ea1f24fae94c0b97eb177a05da22a132","observation_id":"252a8911-3062-4e30-a32e-8ea75c06dd6a","resolution":{"observed_at":"2026-08-07T05:11:17.651486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16391","last_updated":"2026-03-27T17:20:10Z","snapshot_observed_at":"2026-08-07T12:02:49.782674Z","submitted_at":"2026-03-27T17:20:10Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16391","snapshot_observed_at":"2026-08-07T05:11:17.656989Z","title":"Dis- entangled robot learning via separate forward and inverse dynamics pretraining,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.656989Z"},"links":{"cited_paper":"/paper/2604.16391","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:57cf534846f63c9f3d8a65fb64bdc8c42a903f168bf462c3d5c298d24f3dd7f5","observation_id":"1a3694ce-4ac7-40f3-9869-fb8aa9271f21","resolution":{"observed_at":"2026-08-07T05:11:17.656989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-07T05:11:17.662393Z","title":"Fast-wam: Do world action models need test-time future imagination?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.662393Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:04f67e243a17e22226436ed9a263cbb90a58372b6148641c6601fc2e0bc1411c","observation_id":"274cf5f1-2df4-4f45-9a0c-b4300f79d817","resolution":{"observed_at":"2026-08-07T05:11:17.662393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-07T05:11:17.668619Z","title":"Libero-pro: Towards robust and fair evaluation of vision-language-action models beyond memorization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.668619Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:48e35eae0eb4f23de4ea07b0f5a255d5b917ad5fabca6ee26cbd24296ebf87ad","observation_id":"db22e7d6-5501-4104-aa74-41f1b1a8d369","resolution":{"observed_at":"2026-08-07T05:11:17.668619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-07T05:11:17.673796Z","title":"Libero-plus: In-depth robustness analysis of vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.673796Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:847cb4910aa363cc6dbcd55e6a53cf4621b30dbd70de6be6d2b80a8c838912d3","observation_id":"f4aaf29f-d340-49a8-8d5a-4c5506dcef75","resolution":{"observed_at":"2026-08-07T05:11:17.673796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-07T05:11:17.681017Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.681017Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:ab5c2e16cba4a19bc632908a46e0cf9b2477e7075d8be4c029211fa01d14f6c5","observation_id":"3579ca27-3fb3-401a-a797-651b54f99b76","resolution":{"observed_at":"2026-08-07T05:11:17.681017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17846","snapshot_observed_at":"2026-08-07T05:11:17.686150Z","title":"Qwen-robotmanip technical report: Alignment unlocks scale for robotic manipulation foundation models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.686150Z"},"links":{"cited_paper":"/paper/2606.17846","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:57681719b0ca29902044136f4e26d1b0809b724c8b5f95de70600f9dc018f183","observation_id":"ca2363f2-ee95-4de9-a150-5722fb4947f1","resolution":{"observed_at":"2026-08-07T05:11:17.686150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-07T05:11:17.691160Z","title":"Maskwam: Unifying mask prompting and prediction for world-action models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.691160Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:354aa8e01878ceb4fe2faf954d483eecbea5ba4043ecbce19efedb8c18d52232","observation_id":"04b6c163-2a80-4367-a190-1ccbe7ed3311","resolution":{"observed_at":"2026-08-07T05:11:17.691160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-08-07T05:11:17.696014Z","title":"Ctrl-World: A control- lable generative world model for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.696014Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:5081b71492b74e2b3141eb7fe84ac8aba2f4ccde768a96ce006ef5c973395694","observation_id":"d40e0fc6-062b-4f56-b5c5-6f0975c049c7","resolution":{"observed_at":"2026-08-07T05:11:17.696014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.093427Z","title":"IRASim: A fine-grained world model for robot manipulation,","venue":null,"work_id":"0f118065-1f12-4bfa-a4ed-7a4cd15b31be","year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.700583Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:50c85dfcc4b76f3638e8a6bfafd68901360a88891d610c0b927416ec7f71962b","observation_id":"466d0343-4f37-456c-aa83-6601baeaf043","resolution":{"observed_at":"2026-08-07T05:11:20.101037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19017","last_updated":"2025-05-25T07:41:39Z","snapshot_observed_at":"2026-08-08T21:19:45.983336Z","submitted_at":"2025-05-25T07:41:39Z","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19017","snapshot_observed_at":"2026-08-07T05:11:17.705904Z","title":"WorldEval: World model as real-world robot policies evaluator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.705904Z"},"links":{"cited_paper":"/paper/2505.19017","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:fc99426ab27adab89017c7d5723fe205127dbd1cea427ab3d01a5cc9377b2928","observation_id":"1efbc45b-6309-4498-9073-605d916260f6","resolution":{"observed_at":"2026-08-07T05:11:17.705904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.712503Z","title":"WorldGym: World model as an environment for policy evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.712503Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:8e4ccc96e34fbd1a09cb29b1a8e8ad97e756840d420542d82e395e6c1823b542","observation_id":"10c29778-2a76-49a8-a449-42eaa6be5d4c","resolution":{"observed_at":"2026-08-07T05:11:17.712503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.718054Z","title":"Interactive world simulator for robot policy training and evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.718054Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:70040bbb0cd81bb58ce28e7d09e5292731cc95befd706497daf34c38fcd6669b","observation_id":"a4688c2d-8124-43c9-abcd-0885f16a2871","resolution":{"observed_at":"2026-08-07T05:11:17.718054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.070624Z","title":"World Models - David Ha, J ¨urgen Schmidhuber","venue":null,"work_id":"41ea05c1-30ce-4a93-ab81-acdb65483816","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.726140Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:0959d7fc79ebace001c9e34be3139cb68a519b21d2852654a4f88abd1bd2010c","observation_id":"f6fd4601-167a-4dab-bccb-c03d44332628","resolution":{"observed_at":"2026-08-07T05:11:20.076916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.041890Z","title":"Hafner, T","venue":null,"work_id":"4e39ddda-c4e7-4deb-8207-919499a3c548","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.732395Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:4685fd4b68f1a2cea525ad0a893ed7f650b58ab340fa6761e0fa94febb9a2801","observation_id":"bb782729-114b-429f-8e8c-0b5cfa977969","resolution":{"observed_at":"2026-08-07T05:11:20.048968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:20.012354Z","title":null,"venue":null,"work_id":"731926f8-a0f1-4324-8262-4d7625c8f697","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.739120Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:8d8532a8d24a212e302b077d071d1bb50c3dfa9e71b32f87deed38357de876c5","observation_id":"e6c78d16-a765-4c55-927f-467ad3d227d7","resolution":{"observed_at":"2026-08-07T05:11:20.019825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.748919Z","title":"Genie: Generative interactive environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.748919Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:ec3dc8d98b8ee5eab2d381e7523fa60d86fbabcd2a576d209e5f47100dde660c","observation_id":"42c8384e-44dc-4019-8fb3-3355106f403e","resolution":{"observed_at":"2026-08-07T05:11:17.748919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-07T05:11:17.757751Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and plan- ning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.757751Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:233f6f35885722068ede518347dff49766bd8b1e747bb9d9cae1996877111a21","observation_id":"831b2afe-299f-43aa-a172-c960198c1d77","resolution":{"observed_at":"2026-08-07T05:11:17.757751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.958464Z","title":"Agarwal, A","venue":null,"work_id":"fcf11063-577f-434c-be72-610f216a9fc9","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.764869Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e456281ea9151bdfdb3ad7f9e89d7304c92b2e3206e2e8b12d127b7f2eceb121","observation_id":"870dbbd3-3a69-4319-b599-4b876652d7ba","resolution":{"observed_at":"2026-08-07T05:11:19.966354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15840","snapshot_observed_at":"2026-08-07T05:11:17.770649Z","title":"[Online]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.770649Z"},"links":{"cited_paper":"/paper/2512.15840","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:df19403350b3ce213c97b26ce7ae4e8083b4733bd774295df9069dff1b5238c9","observation_id":"3b1be4ce-656f-41ae-899c-4ead8ad32996","resolution":{"observed_at":"2026-08-07T05:11:17.770649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.932471Z","title":null,"venue":null,"work_id":"39636c79-03e3-45de-ac8b-a3e10571c573","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.781509Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:16c5e778b2446a6ca5b1d0477b85dd523a139fe24c6aa4176f4dc500be3018d9","observation_id":"6171344a-c19b-471b-a0b4-bd09e53733e3","resolution":{"observed_at":"2026-08-07T05:11:19.940991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.788447Z","title":"ivideogpt: Interactive videogpts are scalable world models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.788447Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:7644100e2837358db4505fe15553f8b4e530614111cb5a97b230f331b48c2bce","observation_id":"e819d89a-b37a-43e1-be7a-ebde16e6bce9","resolution":{"observed_at":"2026-08-07T05:11:17.788447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.795654Z","title":"Evaluating gemini robotics policies in a veo world simulator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.795654Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e32e8210db8376aff4ebcdb711942a65b98fe131167fb27713ee909fbd9996d8","observation_id":"530dc5a3-2cb8-41b0-ba17-abd46064ea77","resolution":{"observed_at":"2026-08-07T05:11:17.795654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T05:11:17.804072Z","title":"Learning interactive real-world simulators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.804072Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:be51e97100d6436901a5674310251cb70540f7cb5d9c41ca1f318638f18b61a0","observation_id":"4155f45b-5150-4905-ab74-6f1f1797ea4d","resolution":{"observed_at":"2026-08-07T05:11:17.804072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07288","last_updated":"2026-05-08T05:54:33Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:54:33Z","title":"Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07288","snapshot_observed_at":"2026-08-07T05:11:17.810535Z","title":"Sword: Style-robust world models as simulators via dynamic latent bootstrapping for vla policy post-training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.810535Z"},"links":{"cited_paper":"/paper/2605.07288","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:486754e58c837111400df9b94c9d92f9cff8d6ce91b7dbffa55263df0ee7caac","observation_id":"b6b144a6-4949-4c75-adf5-f0a2cb03c398","resolution":{"observed_at":"2026-08-07T05:11:17.810535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-08-07T05:11:17.824972Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.824972Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:eb161a14e16d48aa7b86d1ca490717e215140a35dc53dd1b03944025b8880f16","observation_id":"bbc74074-8a62-4382-a261-7ddb222e8ee3","resolution":{"observed_at":"2026-08-07T05:11:17.824972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.830315Z","title":"Wmpo: World model-based policy optimization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.830315Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:e49498de6218530d84220eeb998ee210382b99a42d567a2d254073fed4c16e2c","observation_id":"35cfe258-3b13-492d-8991-1a0170f92534","resolution":{"observed_at":"2026-08-07T05:11:17.830315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09723","last_updated":"2025-05-14T18:30:53Z","snapshot_observed_at":"2026-08-07T15:45:19.772471Z","submitted_at":"2025-05-14T18:30:53Z","title":"EnerVerse-AC: Envisioning Embodied Environments with Action Condition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09723","snapshot_observed_at":"2026-08-07T05:11:17.835311Z","title":"EnerVerse-AC: Envisioning embodied environments with action con- dition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.835311Z"},"links":{"cited_paper":"/paper/2505.09723","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:507288fb268e4568a7b0447d515e9af9505831dec50a2a83c84dd344ac423b00","observation_id":"4511fb73-d591-4176-b44c-15fc8dfa2bf5","resolution":{"observed_at":"2026-08-07T05:11:17.835311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27491","last_updated":"2026-05-26T16:23:05Z","snapshot_observed_at":"2026-07-31T01:49:07.107998Z","submitted_at":"2026-05-26T16:23:05Z","title":"GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2605.27491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27491","snapshot_observed_at":"2026-08-07T05:11:18.646220Z","title":"GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation","venue":"cs.RO","work_id":"f7650954-a9f9-4dc6-9cd3-29580a8406ac","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.840402Z"},"links":{"cited_paper":"/paper/2605.27491","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:4c76352f621f58a184d1bcce19f20cddba77bdc06a5f808417da5df177b1ce00","observation_id":"914a044b-f939-4326-9c76-3e5a03392f9f","resolution":{"observed_at":"2026-08-07T05:11:18.651607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.859754Z","title":"Precise action-to-video generation through visual action prompts,","venue":null,"work_id":"1442ee5d-1415-4c61-8d81-6b9cbe02f105","year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.847265Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:4c282738bad19e68019b446ffbc12bf8f51e381969df3e073a787e60dca1aacf","observation_id":"1ffa2ac4-f8ba-43d4-809c-87cb14b0b42a","resolution":{"observed_at":"2026-08-07T05:11:19.869356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04463","last_updated":"2026-06-04T13:11:48Z","snapshot_observed_at":"2026-08-02T11:02:18.016581Z","submitted_at":"2026-06-03T05:16:41Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","version":2},"cited_work":{"arxiv_id":"2606.04463","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04463","snapshot_observed_at":"2026-08-07T05:11:18.613389Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","venue":"cs.RO","work_id":"81de9bd4-ee30-43a2-bc4c-687a06dda2b2","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.854274Z"},"links":{"cited_paper":"/paper/2606.04463","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:61be53ce839bc39772735731682c2cb99c9a585a955c105eb166a26ba2346b8e","observation_id":"35881728-cc8a-4fb7-9e51-4ef9be56320d","resolution":{"observed_at":"2026-08-07T05:11:18.620843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.859738Z","title":"BridgeV2W: Bridging video generation models to embodied world models via embodiment masks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.859738Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:0562f0d4e21796cae8a5ea5659dc98e473298fbaf74a939636adaf75c538f09b","observation_id":"50b1cc17-0b56-4d89-8119-eca4b6066bd1","resolution":{"observed_at":"2026-08-07T05:11:17.859738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.864519Z","title":"Kinema4d: Kinematic 4d world modeling for spatiotemporal embodied simula- tion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.864519Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:0c00d3ae25590dff429b1711461f6388afd264a51330787bd7be90d9006c7fcc","observation_id":"3cbdfa84-c976-422d-8e5a-3f085be1fa6e","resolution":{"observed_at":"2026-08-07T05:11:17.864519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.832255Z","title":"Wan-move: Motion-controllable video generation via latent trajectory guidance,","venue":null,"work_id":"471e0865-3dd8-4ada-9cbe-629594e6445a","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.868750Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:19b34de40fb04a553ad5a81cb74e8efcae45bbc8aff1c8bb27669c2ed0ff3fbf","observation_id":"45711f35-90af-43a3-9c67-3d486039be46","resolution":{"observed_at":"2026-08-07T05:11:19.838537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11839","last_updated":"2025-08-03T09:06:58Z","snapshot_observed_at":"2026-08-04T14:15:13.344742Z","submitted_at":"2024-11-18T18:58:03Z","title":"RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11839","snapshot_observed_at":"2026-08-07T05:11:17.872884Z","title":"Robogsim: A real2sim2real robotic gaussian splatting simulator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.872884Z"},"links":{"cited_paper":"/paper/2411.11839","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:75920371418c467c9e373c3877b12e7db6ce120eab44cbf18c8eef96cc05f660","observation_id":"8f86cc58-db33-49df-9c7e-baf89670324b","resolution":{"observed_at":"2026-08-07T05:11:17.872884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.802079Z","title":"High-fidelity simulated data generation for real-world zero-shot robotic manipulation learning with gaussian splatting,","venue":null,"work_id":"f0a0d9d1-9abd-441d-af73-e323d137e04a","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.879658Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:05297e899568983af180913556520304593d7a7ecfdc832024e4b2695f64239a","observation_id":"cd3a864e-192b-427b-9fae-27b49a3c43d7","resolution":{"observed_at":"2026-08-07T05:11:19.812478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13175","last_updated":"2025-04-17T17:59:43Z","snapshot_observed_at":"2026-08-07T16:01:20.885795Z","submitted_at":"2025-04-17T17:59:43Z","title":"Novel Demonstration Generation with Gaussian Splatting Enables Robust One-Shot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13175","snapshot_observed_at":"2026-08-07T05:11:17.886294Z","title":"Novel demonstration generation with gaussian splatting enables ro- bust one-shot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.886294Z"},"links":{"cited_paper":"/paper/2504.13175","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:b27e5edd5d00845277e4e1a2ba159b96c1f627120f53d860f5c896e95fcf2e14","observation_id":"87e8238a-5a44-4796-afee-303df3aa357c","resolution":{"observed_at":"2026-08-07T05:11:17.886294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01773","last_updated":"2026-04-15T17:13:09Z","snapshot_observed_at":"2026-08-03T04:29:49.820139Z","submitted_at":"2025-12-01T15:15:04Z","title":"IGen: Scalable Data Generation for Robot Learning from Open-World Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.01773","snapshot_observed_at":"2026-08-07T05:11:17.893599Z","title":"Igen: Scalable data generation for robot learning from open-world images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.893599Z"},"links":{"cited_paper":"/paper/2512.01773","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:07852b807fe84f08a0a89c48905c9b1633fb5e01cd578bd7e69821c3525df5d2","observation_id":"7fd1e8af-f8e1-4d31-bdd4-c9ac6e41649e","resolution":{"observed_at":"2026-08-07T05:11:17.893599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.898251Z","title":"Roboengine: Plug-and-play robot data augmentation with semantic robot segmen- tation and background generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.898251Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:d04c7dbe0cb4b01547f1e1d6e2c88fae67193df062c26696c6b15ec1f8e4b7bf","observation_id":"5f1f3f87-a1b2-4946-96cc-f6ca8b125fd3","resolution":{"observed_at":"2026-08-07T05:11:17.898251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.11797","last_updated":"2026-07-06T16:12:36Z","snapshot_observed_at":"2026-08-07T04:27:57.624555Z","submitted_at":"2025-12-12T18:59:45Z","title":"AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.11797","snapshot_observed_at":"2026-08-07T05:11:17.903025Z","title":"Anchordream: Repurposing video dif- fusion for embodiment-aware robot data synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.903025Z"},"links":{"cited_paper":"/paper/2512.11797","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9f2468ae377767da46e84efddf430b7535a4a5fe9d69b8163ffed66af5b03ff2","observation_id":"3ef0a90f-e8fe-42f6-82f9-453a3c8da551","resolution":{"observed_at":"2026-08-07T05:11:17.903025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-08-07T16:54:09.884104Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-08-07T05:11:17.907762Z","title":"Cosmos-transfer1: Conditional world generation with adaptive multimodal control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.907762Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:45eda138c16c0b8e413f94bc1df4c9ee5c3ff4e54d63c0ea2cbd2a6e33ab42fe","observation_id":"a03fb650-5bff-4705-b7c1-4543145f788a","resolution":{"observed_at":"2026-08-07T05:11:17.907762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-07T05:11:17.912736Z","title":"Dream- Dojo: A generalist robot world model from large-scale human videos,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.912736Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:f8df34344be47e6be096622198e91cbe255ab2bfd0e5a6a5c61d943bc6b5340a","observation_id":"06fa865d-1d02-4759-a6ec-42c3d7527766","resolution":{"observed_at":"2026-08-07T05:11:17.912736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-08-07T05:11:17.917459Z","title":"Dreamgen: Unlocking generaliza- tion in robot learning through video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.917459Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c7924c8d085e1e9801376331e08b08881307044804eaa09e282c1e4953632c61","observation_id":"5b765615-2839-4146-8567-c720baeb93a1","resolution":{"observed_at":"2026-08-07T05:11:17.917459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.751579Z","title":null,"venue":null,"work_id":"08e68ae7-bbea-4792-ade9-c7c9300ad137","year":null},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.921893Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:8b582bf0764148933963acc4234b9ce89651d4bec7973f0ea693f27f2f374686","observation_id":"c686bb2d-a2d3-47e7-9adb-7c3090e1d244","resolution":{"observed_at":"2026-08-07T05:11:19.757981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T05:11:17.926316Z","title":"Wan: Open and advanced large-scale video generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.926316Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:1c7b533b3121d4cc8eb10c93ce294b326d139c423049c9fbd166a165700713bf","observation_id":"aea54a54-7f52-4346-9c5e-0c73fc65c0e5","resolution":{"observed_at":"2026-08-07T05:11:17.926316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.731555Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion,","venue":null,"work_id":"76fcb3d7-1c35-40aa-8d11-e08ee1c00857","year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.931131Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9705c70272ad79e2255043e9e662110fbb3b3c2faa0fc0e7ede11a0f48aa0d68","observation_id":"7c52a9ad-cbb8-4aad-803e-0179768028ef","resolution":{"observed_at":"2026-08-07T05:11:19.737577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T05:11:17.935956Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.935956Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:c08b9ba99b3c1725e4739c8c1ef61d733650812871612b517a387e316ed4e2d6","observation_id":"8ea7eb8b-fbd3-4b9b-9949-13b9b1965d24","resolution":{"observed_at":"2026-08-07T05:11:17.935956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.940525Z","title":"WorldArena: A unified benchmark for evaluating perception and functional utility of embodied world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.940525Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:341d63152bf7761138ccb277cb1a038e8d476e0462202e336a684dfcc02fbadb","observation_id":"27b636e4-6861-418f-82a7-fdaf63314761","resolution":{"observed_at":"2026-08-07T05:11:17.940525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.945280Z","title":"Image quality assessment: from error visibility to structural similarity,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.945280Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:be7338ff9bb9d6ddef7ebfbddbff92b2c6eece6ff2f7fde21e6d0102a3b5eebb","observation_id":"5e132b18-83cb-4a3d-90a8-ead660623db4","resolution":{"observed_at":"2026-08-07T05:11:17.945280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.696055Z","title":"The unreasonable effectiveness of deep features as a perceptual metric,","venue":null,"work_id":"d5afcc2a-b3ce-4831-8d78-4696b608c02e","year":2018},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.950096Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:39f9f81902c7ab0a3209d17c953567eedc5ef4bb28a3a7932321d99dde858576","observation_id":"4cce9cc0-31c5-4c0f-b706-e640fdc8a4b6","resolution":{"observed_at":"2026-08-07T05:11:19.703609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:17.954386Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.954386Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:35957eff0a89924ca9dffff46e93bb1d671c38522b30bc49e5358c8ef421c85a","observation_id":"f30d3a87-2b19-4709-8ccc-5da2d8e21184","resolution":{"observed_at":"2026-08-07T05:11:17.954386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T05:11:17.958781Z","title":"Towards accurate generative models of video: A new metric & challenges,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.958781Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:a493c33e89b51d5779aefd9de83ff30110c9d8aa702ce0eb77d4444525f5e643","observation_id":"aedda6da-ee0d-4a4f-a02c-2a8dfdcf8e17","resolution":{"observed_at":"2026-08-07T05:11:17.958781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.656914Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":"a1d200de-93bc-47b2-9d2e-5eaf8e3969bb","year":2023},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.971304Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:28c4192ca76fe496f1f35ff9fa2cf65871cc7edea0ab384418cc69a708b8de5e","observation_id":"ef2b976c-b85a-4313-87b6-897a96a2b1f1","resolution":{"observed_at":"2026-08-07T05:11:19.664560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T05:11:17.976493Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.976493Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:9880c1ae0e4521abd0bc3397c33bbfc5ad447b04890e380cfa03d28adcb226b7","observation_id":"d3dfbd5e-ed53-423f-ae54-108891286054","resolution":{"observed_at":"2026-08-07T05:11:17.976493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:11:17.981086Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.981086Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:34af8960f128af4b4b151e9c780bde7ff32d5fbea834c45512eb821bcd9f67dd","observation_id":"a3725577-0d46-4b91-b0b6-0c38e96bde01","resolution":{"observed_at":"2026-08-07T05:11:17.981086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:11:19.633254Z","title":"Introducing our latest image generation model in the API,","venue":null,"work_id":"296c55f3-94de-4499-9a77-76b3dc3971ef","year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.985725Z"},"links":{"citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:25ae1e200d47c3b6cae9dba88b41cb3441c8ebfc78c3c0970730a2834a37b5e3","observation_id":"caf14684-d9b4-424b-8063-674dcc8406aa","resolution":{"observed_at":"2026-08-07T05:11:19.641811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-07T05:11:17.990150Z","title":"Qwen-image technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.990150Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:d407dadb61a5d34242f2749b8e234e06fd251a1aa56f0ae95706fa5b2bc95075","observation_id":"9d5cc391-3755-40eb-9256-3a2231f6e657","resolution":{"observed_at":"2026-08-07T05:11:17.990150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T23:18:04.367488Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2608.06332."}