{"as_of":"2026-08-16T04:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af9d2f8778a6b9270507729821e4366d1e92d8b2d7d0106cefe24d921ebcf1ae","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T23:01:13.546110Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":145,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:42:24.884169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-06T19:42:24.884169Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05169","last_updated":"2026-06-17T19:20:50Z","snapshot_observed_at":"2026-08-11T20:10:01.350597Z","submitted_at":"2025-07-07T16:23:46Z","title":"Critique of World Model","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:42:24.884169Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2507.05169"},"observation_digest":"sha256:309e12cabacdc4f422975dc81096c18b2ee7824f25bdcbd334d0fca76c06cfda","observation_id":"fa515d66-8adc-4190-9ce9-b7cb599cf1bb","resolution":{"observed_at":"2026-08-06T19:42:24.884169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T18:05:46.912489Z","title":"arXiv preprint arXiv:2511.00062 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15163","last_updated":"2025-08-21T02:01:49Z","snapshot_observed_at":"2026-08-13T03:14:24.527284Z","submitted_at":"2025-08-21T02:01:49Z","title":"Non-invasive Assessment of Pancreatic Duct Hypertension Using Computational Flow Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T18:05:46.912489Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2508.15163"},"observation_digest":"sha256:b24e192dd0ae07ba847a8db939a80a993d89768f93d1bf08f50adda7707d628a","observation_id":"3f536bf9-a60d-45b9-8dfa-2c26111dbfac","resolution":{"observed_at":"2026-08-05T18:05:46.912489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T21:14:08.241793Z","title":"World sim- ulation with video foundation models for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17649","last_updated":"2026-07-07T04:04:31Z","snapshot_observed_at":"2026-08-07T15:20:09.839961Z","submitted_at":"2025-11-20T09:52:20Z","title":"SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:08.241793Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2511.17649"},"observation_digest":"sha256:bdbfcfa378d3c146abc511247c35368d2994f6e78e4801d91498404616f3d704","observation_id":"b3a173d5-3c1b-43f1-b9e8-e75981a48582","resolution":{"observed_at":"2026-08-03T21:14:08.241793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2511.23230","last_updated":"2026-04-04T17:59:32Z","snapshot_observed_at":"2026-08-13T06:11:09.515857Z","submitted_at":"2025-11-28T14:40:03Z","title":"Action-guided generation of 3D functionality segmentation data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T04:49:06.269256Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2511.23230"},"observation_digest":"sha256:5457735740dea0155e4d41c00e49a55b5764d30efc21dd630f1f557abb175e4f","observation_id":"19866105-002a-4d37-a1c4-952a478a6906","resolution":{"observed_at":"2026-05-17T04:51:31.961334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:00.142543Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.15692"},"observation_digest":"sha256:ccb1c9b62dbde3059fecd5415d06827366ef81c2b2d9dc382c7c25775e8d129b","observation_id":"ffb8ebf1-a0b8-4ab6-b101-e4f911ddd5bf","resolution":{"observed_at":"2026-05-15T10:41:00.371735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.17445","last_updated":"2026-04-08T21:08:41Z","snapshot_observed_at":"2026-08-15T01:21:45.522972Z","submitted_at":"2025-12-19T10:57:03Z","title":"LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T20:56:58.770875Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.17445"},"observation_digest":"sha256:67648e2a309a3b19dd2d0a543796572fb0cef71d01dc9dc51994b87e742591a8","observation_id":"0ea168d0-4a6f-44bd-9c15-f0726a94a156","resolution":{"observed_at":"2026-05-16T20:58:31.824406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:a174faaae302de6b96b359d39f673c21d1d2a6550803d26de74c84f4e1dfafe3","observation_id":"42fe7b14-e06f-41cd-ac2d-85ccf240be77","resolution":{"observed_at":"2026-05-16T19:28:20.868354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-08-10T21:24:55.790519Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T19:34:39.518649Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.23421"},"observation_digest":"sha256:51f3b1b3448e3cdcff8e9e314809b1aefafe2f7dd363f93e3d50e1b2e8ef9c3d","observation_id":"0c5207d5-c917-4f4d-a024-e34e56eab943","resolution":{"observed_at":"2026-05-16T19:38:21.104574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T12:37:28.494262Z","title":"World simulation with video foundation models for physical ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02295","last_updated":"2026-07-28T17:46:45Z","snapshot_observed_at":"2026-08-14T04:22:46.402021Z","submitted_at":"2026-01-05T17:31:01Z","title":"CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T12:37:28.494262Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2601.02295"},"observation_digest":"sha256:3fe24ec716df417b839f0630918027c964d4f5fb73d8a3ceaa7a652e6effbaf3","observation_id":"0110820c-4239-499e-a7bd-9fce4a723f27","resolution":{"observed_at":"2026-08-03T12:37:28.494262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T09:07:00.904794Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2601.20540"},"observation_digest":"sha256:9f84c85853eed7c534ba1d022aa2b5e2696c1812465d30da0d868954569e0286","observation_id":"cd8451bc-67de-427e-94c8-e4efbcaf06f5","resolution":{"observed_at":"2026-05-16T09:07:00.942546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T03:56:47.126834Z","title":"World simulation with video foundation models for physical ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06508","last_updated":"2026-05-25T03:56:37Z","snapshot_observed_at":"2026-08-03T03:56:46.452714Z","submitted_at":"2026-02-06T08:57:55Z","title":"World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:56:47.126834Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.06508"},"observation_digest":"sha256:37d2ac5e7164a4524099de425a65f136d6432482fe394f47f2c14d0dc53e0105","observation_id":"f9612596-cb44-414f-bc59-5f979c5d309c","resolution":{"observed_at":"2026-08-03T03:56:47.126834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:bb0ddab26877da2632614aa4c2ec9730aec3ac23e668e6337e49fda899a1eff3","observation_id":"e9d9abb1-f484-4fe4-8a09-de5a2e057d81","resolution":{"observed_at":"2026-05-16T17:02:34.267430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-08-15T00:49:04.808892Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:cb87e4bd6bb27b7216cc566f7296e2fd97ce94275b0bb89a30309fbb54829e89","observation_id":"7332bf28-128b-4f1d-95c3-82f7f3f881f3","resolution":{"observed_at":"2026-05-16T07:07:30.032697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:6db744717c5ac79d48cdf26f4dce44a0d4194f107626d50412c92392b731c45a","observation_id":"d218176b-7e28-444f-b351-30d5d2c1c658","resolution":{"observed_at":"2026-05-16T02:30:32.148569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:8103ddc40fa76694c25892c49351107fd35c4ea0393d419653bb174f37ed0f9b","observation_id":"e8de21ed-7a5e-4bd5-aa18-5e3d79c67d72","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2603.11755","last_updated":"2026-06-29T14:21:14Z","snapshot_observed_at":"2026-07-14T22:39:44.966501Z","submitted_at":"2026-03-12T10:02:23Z","title":"Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T12:18:45.538658Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2603.11755"},"observation_digest":"sha256:6bfec3863b0004ee93948cd660cdf7201f9e00c442db32b89c90669d16ed79b9","observation_id":"fd1e209b-bbf7-4fd5-8078-18c3e1614fa1","resolution":{"observed_at":"2026-05-15T12:20:00.593719Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:b56c8856836f812949ab2ac1ba097b79347e56fea4841bed9aecbb74531bb654","observation_id":"829bb067-274d-43b5-9162-ab1af4f452bf","resolution":{"observed_at":"2026-05-14T01:38:36.297567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T02:31:02.007136Z","title":"arXiv preprint arXiv:2511.00062 (2025) 4 TRACE 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-13T01:45:01.629353Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.007136Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:fd926560ca944f3027045452fe4a0fcaef8852431760d79b8a2a1a46a0056380","observation_id":"a553edc2-0934-4d58-81eb-de4ec5248f1e","resolution":{"observed_at":"2026-08-03T02:31:02.007136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.01907","last_updated":"2026-04-24T08:02:33Z","snapshot_observed_at":"2026-08-12T18:19:19.339521Z","submitted_at":"2026-04-02T11:26:44Z","title":"Lifting Unlabeled Internet-level Data for 3D Scene Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:57.890955Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.01907"},"observation_digest":"sha256:5b75c414f88c04d0ab798cb59c71a3c8bb5328abcc6801eb0d7e1d8d7a76d319","observation_id":"f428f70b-ebc1-4390-bd81-c670992afeec","resolution":{"observed_at":"2026-05-13T22:18:21.015364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-08-10T20:11:35.866439Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:80ae3ef8a28844417a7e529f0ce79efa21c72e63e3d478abb4b788dade45d37e","observation_id":"d7239c86-ffbd-4f65-8fc4-5d87d982b5f2","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-08-10T20:11:35.866439Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:623402d20aaee07a8932622806bfaf7b75e84747625423e0148a1dbcec25a9fe","observation_id":"d6ab8ce6-250c-4191-aa3f-8b7db6070145","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.06168","last_updated":"2026-04-15T01:21:52Z","snapshot_observed_at":"2026-08-11T00:13:32.050236Z","submitted_at":"2026-04-07T17:59:30Z","title":"Action Images: End-to-End Policy Learning via Multiview Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:05.206602Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.06168"},"observation_digest":"sha256:775d9e90acf22f12e3aa5fe6ae36218e7b6876df4c83d3473ad67aecf7035a63","observation_id":"abdbe0d3-d15a-446e-b6c7-e80340e0ec62","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.07990","last_updated":"2026-04-26T05:22:47Z","snapshot_observed_at":"2026-08-11T08:51:25.778493Z","submitted_at":"2026-04-09T08:59:33Z","title":"SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:23.355682Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.07990"},"observation_digest":"sha256:edaf79b4eaf8ab771f3d864ff9031441259312ccf09e89dbcba4d12666cff363","observation_id":"422b8182-9835-4b95-95b1-4473873e0e50","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.07991","last_updated":"2026-04-09T08:59:40Z","snapshot_observed_at":"2026-08-11T04:17:12.366150Z","submitted_at":"2026-04-09T08:59:40Z","title":"MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:11:14.242522Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.07991"},"observation_digest":"sha256:daee40435f0ff98daee3c37388c96c323e548b814b0c2a0e961db6babb988596","observation_id":"83cdf01c-32a7-4a92-9d8d-2a7220f58fed","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.11707","last_updated":"2026-04-13T16:42:46Z","snapshot_observed_at":"2026-08-14T02:26:44.424103Z","submitted_at":"2026-04-13T16:42:46Z","title":"Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:53.578491Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.11707"},"observation_digest":"sha256:1d50f6796adc344172e71bc5311ff3a78dedad801ea3cd026ce8a9f66b791891","observation_id":"50bb55b6-4159-413c-abc3-14c00f504715","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.11797","last_updated":"2026-04-14T21:52:23Z","snapshot_observed_at":"2026-08-11T15:42:33.913460Z","submitted_at":"2026-04-13T17:58:06Z","title":"SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:20:04.440192Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.11797"},"observation_digest":"sha256:f463edb1b0a2e18910dd4bfdffadd778c3973d70d559a8b69cfb5898eee90dd0","observation_id":"780fa249-5e2b-40b1-9161-f5c2d82e6cbf","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.15569","last_updated":"2026-04-16T22:55:39Z","snapshot_observed_at":"2026-08-13T14:31:44.188727Z","submitted_at":"2026-04-16T22:55:39Z","title":"ShapeGen: Robotic Data Generation for Category-Level Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T10:17:05.939312Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.15569"},"observation_digest":"sha256:1db9c0a2e4140506441a7b16618d9812cb53b1a164ffe337a58f87b571b0ebfb","observation_id":"479e6cdb-9b9b-4c34-8193-940ee358f451","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.15805","last_updated":"2026-04-17T08:06:26Z","snapshot_observed_at":"2026-08-11T00:17:25.465654Z","submitted_at":"2026-04-17T08:06:26Z","title":"From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T08:45:46.944379Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.15805"},"observation_digest":"sha256:a8ed488126607b3c05951e1b151a4be2da9576b0eec8cc444c667e12ad91040f","observation_id":"0ed5f6d6-1d1c-4220-bacc-ff5fe532e494","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:d613ebfddc82bd6ac868382e1cfa38622a97757a345d39116e411ed4b9047495","observation_id":"062bf222-1e5a-4795-80f6-c44d909a736a","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-13T06:58:22.980677Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:03:06.920592Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:a95fe1d9f5831e9d33e390744b2ed0bfe19865c87e04f26930ba650e68ecda40","observation_id":"476c1df0-c9b8-43a1-ba13-518b7294a8ab","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-13T06:58:22.980677Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:58.232585Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:5a31453fd7ddb155b203da6061bdca5968e61a9c8a9f967597209cb57b0299e1","observation_id":"a36559ad-8a7a-46a8-9299-77092c1d3db8","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-08-13T06:58:22.980677Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T16:47:32.853010Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:06b2c1541b897a902fb14b0aed2c27e023fd99b8ba31079515e86b68382608c4","observation_id":"9510abdc-f1c1-4fae-86d0-b88035f03019","resolution":{"observed_at":"2026-07-05T16:51:14.240617Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-08-11T21:17:05.183857Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:6facc67659db3cb19b5973cfa7e126af6f7c46864cf47768f662113157182f5d","observation_id":"a1d3144e-8776-4ac3-b493-34198b3f9357","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-08-14T22:39:17.670914Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:e0c4c56ea67776d7d2dcf848ced9b084c99fd25ead9d3a337aab440fb08ab272","observation_id":"7d185eac-58e0-45a9-8009-1b1b9f3e4da6","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-08-14T22:39:17.670914Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:6aa15c64e5e0f17a1984b0adf898675876f7777f5888fcf3c3566c06fda2794a","observation_id":"08d65f79-7c4b-4ebf-98d5-bb5732f81ade","resolution":{"observed_at":"2026-05-15T06:19:50.279253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-08-15T06:57:44.935343Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:17.676675Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.19683"},"observation_digest":"sha256:957123b0335a98ebc543101a304ec6c18dd24fb4df7434ecd6025c88f7c5e62c","observation_id":"cc575329-78a5-4ad9-8af7-fe0ea9cf7c5d","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.21017","last_updated":"2026-06-04T17:26:29Z","snapshot_observed_at":"2026-08-11T09:42:23.957234Z","submitted_at":"2026-04-22T19:05:17Z","title":"Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T23:53:09.614994Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.21017"},"observation_digest":"sha256:40b23c203dc0a6602fa75a4ced5145e86e3472b67bee65133c97e2612cecbfe5","observation_id":"e736b80b-c559-45cf-96f9-f4ffd6c23873","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.21741","last_updated":"2026-05-05T16:01:35Z","snapshot_observed_at":"2026-07-29T22:30:00.899443Z","submitted_at":"2026-04-23T14:42:54Z","title":"Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T21:26:26.540403Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.21741"},"observation_digest":"sha256:d8e6928efce4830a4845bf87155fb1efa46d3135215cfcec1f079b73085c4d31","observation_id":"4e5f7877-17c3-4ec6-a432-db1e23b5cccf","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.28185","last_updated":"2026-04-30T17:59:02Z","snapshot_observed_at":"2026-08-10T07:23:48.304270Z","submitted_at":"2026-04-30T17:59:02Z","title":"Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T06:38:04.459129Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.28185"},"observation_digest":"sha256:4d80bf323df54e12cc23ca30a71957137f77304d45406905c54314a8f0c56ed9","observation_id":"b0566a21-f8cf-4eff-9d9e-a1eba39f51b7","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.00050","last_updated":"2026-04-29T14:33:27Z","snapshot_observed_at":"2026-08-11T16:16:31.649032Z","submitted_at":"2026-04-29T14:33:27Z","title":"Learning physically grounded traffic accident reconstruction from public accident reports","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T19:59:27.929899Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.00050"},"observation_digest":"sha256:282a42032af2f43bd0fbcb523a017135ec7153e143a3945a78572167b896f4b0","observation_id":"34795d18-378b-4dc0-aa2b-d1cebad163ee","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.00080","last_updated":"2026-04-30T14:35:31Z","snapshot_observed_at":"2026-08-04T20:02:32.182599Z","submitted_at":"2026-04-30T14:35:31Z","title":"World Model for Robot Learning: A Comprehensive Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T20:38:12.709629Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.00080"},"observation_digest":"sha256:7dfd94946e56426adf8fcd280f33b51bd58f02e8097f9a2c76e06599491d9d4e","observation_id":"53bbaa4a-b583-462f-9ea3-f96b48cdd36e","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.02757","last_updated":"2026-05-04T15:57:07Z","snapshot_observed_at":"2026-08-11T00:21:08.790870Z","submitted_at":"2026-05-04T15:57:07Z","title":"Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T18:21:00.089755Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.02757"},"observation_digest":"sha256:f162f83a48590a4037ec09dacedf35d0c5f16c122cd59148175f3ee4fa9029dd","observation_id":"096cd1c8-87f2-4264-806f-9488893c8fc6","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:10.595164Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:29604b391dd21e8bc8ad42080d5b8768f7a4de6cc955c1f17bf86372fa6a8bf7","observation_id":"530c4c0e-acb4-45b7-a087-145d7c9c3d87","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T19:02:19.756092Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:5dd73e6aeaafafdb07a8e5c8edc09c824c672c327933f2a1e16bd9d24f2f1491","observation_id":"3014a16a-ab53-4b04-ae5b-40792c4d8723","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.07514","last_updated":"2026-05-08T09:44:43Z","snapshot_observed_at":"2026-08-11T08:10:03.815803Z","submitted_at":"2026-05-08T09:44:43Z","title":"Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:31:30.530595Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.07514"},"observation_digest":"sha256:f54dbcfeffa0ab9cb9371ceb1ba131f9f0fbd6f64254826f7396b67a0e46219b","observation_id":"9fb38d36-dac3-47be-8b49-1d3c523199e9","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.08735","last_updated":"2026-05-09T06:39:17Z","snapshot_observed_at":"2026-08-11T17:56:35.696156Z","submitted_at":"2026-05-09T06:39:17Z","title":"CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T02:17:30.227755Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.08735"},"observation_digest":"sha256:dca76170f739992d522dffe442138d5c9aa46914605257bb34866fbdb507ffda","observation_id":"c8695a0e-d55a-4eee-ab2c-18803b91979e","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.12334","last_updated":"2026-05-20T07:28:11Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:16:15Z","title":"Reinforcing VLAs in Task-Agnostic World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T04:17:51.349213Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.12334"},"observation_digest":"sha256:16912f0fed4f797779563a689c713f210a4d34ee7735a43c69932b4e39170916","observation_id":"a07cccf4-f49a-42f0-af2b-663b6299d52d","resolution":{"observed_at":"2026-05-13T04:27:14.277708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.12334","last_updated":"2026-05-20T07:28:11Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:16:15Z","title":"Reinforcing VLAs in Task-Agnostic World Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T08:13:40.975340Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.12334"},"observation_digest":"sha256:0206f85e1c654165fbc8f25cbdd2ec424235464f22eb80142f0ebc7c7aeab365","observation_id":"986f8d80-af33-4be2-8288-fdd7ba5dba9f","resolution":{"observed_at":"2026-05-21T08:14:03.037059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.13790","last_updated":"2026-05-13T17:11:07Z","snapshot_observed_at":"2026-08-15T18:27:34.267701Z","submitted_at":"2026-05-13T17:11:07Z","title":"Di-BiLPS: Denoising induced Bidirectional Latent-PDE-Solver under Sparse Observations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:06:18.193097Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.13790"},"observation_digest":"sha256:ae53a3afbe3e205dea8b2a87369c30cdad65e272aca662f44e01c9589f625afd","observation_id":"516c767b-71c5-4c2f-91d5-68956fcce97e","resolution":{"observed_at":"2026-05-14T19:07:50.987224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.14398","last_updated":"2026-05-29T19:42:20Z","snapshot_observed_at":"2026-08-14T23:12:21.423799Z","submitted_at":"2026-05-14T05:33:41Z","title":"Coding Agent Is Good As World Simulator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:19:49.149075Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.14398"},"observation_digest":"sha256:a6c13e8cc83ad2faf07bd6217e830285fc63323937a6fa3b6341da56539113a2","observation_id":"d4c23c5c-4dd4-489f-a9bd-f90ffb6b02f6","resolution":{"observed_at":"2026-05-15T02:23:32.034608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.14398","last_updated":"2026-05-29T19:42:20Z","snapshot_observed_at":"2026-08-14T23:12:21.423799Z","submitted_at":"2026-05-14T05:33:41Z","title":"Coding Agent Is Good As World Simulator","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T20:55:16.040505Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.14398"},"observation_digest":"sha256:6535b0f591104e17120364ea375560350e0fe2c4c37b9a08866bf4ff34781002","observation_id":"a078f570-9f76-4132-8f15-06ccece8828e","resolution":{"observed_at":"2026-07-01T14:35:46.852607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.15116","last_updated":"2026-05-14T17:29:35Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:29:35Z","title":"DriveCtrl: Conditioned Sim-to-Real Driving Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:06:06.548538Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.15116"},"observation_digest":"sha256:e7e695931d1b350bd96d4859811b554b21b9dd95f9261edbb742592fafea334c","observation_id":"b5ed68ce-66e3-44de-8b02-9e582067c172","resolution":{"observed_at":"2026-06-30T21:15:04.787272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.15153","last_updated":"2026-05-21T16:50:35Z","snapshot_observed_at":"2026-08-13T15:29:21.214754Z","submitted_at":"2026-05-14T17:50:42Z","title":"Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T03:15:35.678011Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.15153"},"observation_digest":"sha256:f81acfea55b92fd51463c35598416141b32e63c751d9feffd6a22a30090ed644","observation_id":"d91c1c62-87f3-4fc8-a354-8c5c442bcfca","resolution":{"observed_at":"2026-05-15T03:19:44.187738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.15153","last_updated":"2026-05-21T16:50:35Z","snapshot_observed_at":"2026-08-13T15:29:21.214754Z","submitted_at":"2026-05-14T17:50:42Z","title":"Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:45:13.742534Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.15153"},"observation_digest":"sha256:4d42f9034e55db614882bb0d28d8bf4a6bd070c47cdc1bb41502c34dd2b99a95","observation_id":"173d31fe-008e-4bbe-86ce-73d7b0502d74","resolution":{"observed_at":"2026-05-22T09:46:22.452132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17077","last_updated":"2026-05-16T16:52:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T16:52:08Z","title":"How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T15:18:40.457780Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17077"},"observation_digest":"sha256:ae5209d58718a2a482aa142067f5a2bdc09039bbf4a034ea3829c18b260f94a6","observation_id":"425ee546-4408-47c4-bd50-17460cbc0c11","resolution":{"observed_at":"2026-05-20T15:23:25.279166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17537","last_updated":"2026-05-25T09:18:44Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:42:42Z","title":"Self-supervised Hierarchical Visual Reasoning with World Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:41:17.559901Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17537"},"observation_digest":"sha256:c1753fd39fe07c69f67ace76005d06b1f276aeb4091d0e9cfbe3a8a65f2766d3","observation_id":"fa290429-9457-46bb-9934-66c82d90dacd","resolution":{"observed_at":"2026-05-20T12:43:16.866382Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17537","last_updated":"2026-05-25T09:18:44Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:42:42Z","title":"Self-supervised Hierarchical Visual Reasoning with World Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T19:04:33.433907Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17537"},"observation_digest":"sha256:3275d6d9071a941063fb7177883bc31dd8e408810d34e6bf00cbc24dcd8ae8bc","observation_id":"95302fe6-4ace-4927-a355-6ff92b627d65","resolution":{"observed_at":"2026-06-30T19:05:00.273959Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17912","last_updated":"2026-05-18T06:18:21Z","snapshot_observed_at":"2026-08-15T12:19:19.921672Z","submitted_at":"2026-05-18T06:18:21Z","title":"WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T10:59:54.879907Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17912"},"observation_digest":"sha256:451f22e3f97e7ba1f624df3ca7ef8c563802a91eba1ac39da0f320d10bd12778","observation_id":"88a07589-9b1c-4766-8c1e-09818ccd60fa","resolution":{"observed_at":"2026-05-20T11:03:13.688410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.18396","last_updated":"2026-05-19T06:23:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:42:24Z","title":"NEWTON: Agentic Planning for Physically Grounded Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:22.343333Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.18396"},"observation_digest":"sha256:bc512150bf43c6edaa142c4d06dce03b0b9db726420ec2e909541f0920724875","observation_id":"5d7afa79-4545-41d9-832b-d6af11a6f445","resolution":{"observed_at":"2026-05-20T10:58:13.800270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:bbe43e214a9e08afa0c80b093bb6a1f665639e8ae145f6cc68bdd959ac102b08","observation_id":"d1e93c55-63b7-496a-bac3-7e435c202e64","resolution":{"observed_at":"2026-05-20T07:33:07.562468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.19957","last_updated":"2026-05-19T15:10:27Z","snapshot_observed_at":"2026-08-15T13:43:15.848387Z","submitted_at":"2026-05-19T15:10:27Z","title":"World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T06:36:47.265734Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.19957"},"observation_digest":"sha256:3cedc1832e4832d9244216285041b4f6b52b0a968a448e5db75027045c5c1108","observation_id":"2d959405-5891-4b63-899e-9b1337ae3a52","resolution":{"observed_at":"2026-05-20T06:38:05.636274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.20624","last_updated":"2026-05-20T02:16:30Z","snapshot_observed_at":"2026-08-04T08:46:12.560576Z","submitted_at":"2026-05-20T02:16:30Z","title":"Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T06:12:31.783615Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.20624"},"observation_digest":"sha256:872971d09e20e79e22551f40ea7343d022c143a634329e14177c9d28cfd28fab","observation_id":"9c206a40-a2dd-4020-a16e-0e2c99729dab","resolution":{"observed_at":"2026-05-21T06:13:59.578801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:75cabaeb8f0745f4cea1baa431cf8d8bd57422add3964cce83c6509bce9723ce","observation_id":"1a8f9b0a-1dbb-49ec-a680-f27e3d4dae36","resolution":{"observed_at":"2026-05-25T04:40:23.268359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-11T22:24:10.474320Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:5cbfded4a2dc09343a6a4e246008a0fe5dfb27d91f38e788fa18c9b101e5bea1","observation_id":"7cfd86f1-b242-4fd6-92ef-9e9ec2370a0f","resolution":{"observed_at":"2026-06-29T18:23:50.356445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.28230","last_updated":"2026-05-27T09:44:18Z","snapshot_observed_at":"2026-08-07T12:12:27.862303Z","submitted_at":"2026-05-27T09:44:18Z","title":"Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:55:24.689338Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.28230"},"observation_digest":"sha256:4fcdfcc400d115ce4de30fbf04c5891ffdffcf76e9d36c9bdeba7f3220644486","observation_id":"68f05e78-715d-4bcd-a2b8-b9b3a4a8522a","resolution":{"observed_at":"2026-06-29T13:03:26.638052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.28816","last_updated":"2026-05-27T17:59:31Z","snapshot_observed_at":"2026-08-13T23:19:52.582867Z","submitted_at":"2026-05-27T17:59:31Z","title":"Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:34:03.020051Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.28816"},"observation_digest":"sha256:c66a2fd81211869482e6e19429dc563490dd74faf9fbe781486136a8923c9d18","observation_id":"2e702759-30b6-42cf-aadf-a3d2d85f50ad","resolution":{"observed_at":"2026-06-29T13:53:29.115357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.00133","last_updated":"2026-05-28T21:23:24Z","snapshot_observed_at":"2026-08-15T10:40:39.438182Z","submitted_at":"2026-05-28T21:23:24Z","title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:23.776293Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.00133"},"observation_digest":"sha256:4f2cd0516d3dcd4757687c08673df4cd9eee463907ca012e79fdd7eb84fc43a7","observation_id":"226e4e9c-60ca-4416-9714-e137062acefc","resolution":{"observed_at":"2026-06-29T08:43:15.654464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.00499","last_updated":"2026-05-30T03:13:00Z","snapshot_observed_at":"2026-08-09T10:23:42.127989Z","submitted_at":"2026-05-30T03:13:00Z","title":"OptiWorld: Optimal Control for Video World Generation under Physical Constraints","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T19:02:51.848742Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.00499"},"observation_digest":"sha256:91fd4c05f5d8b4b7cfd8f2e8bc36e3e0ddb62a1d0bb590a3ae6e3af4b96d73d7","observation_id":"0713b3dc-b9e4-4d64-a9ae-05704cec4938","resolution":{"observed_at":"2026-06-28T19:32:35.509546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.01027","last_updated":"2026-05-31T05:35:36Z","snapshot_observed_at":"2026-08-14T06:42:43.836245Z","submitted_at":"2026-05-31T05:35:36Z","title":"$\\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:21:06.079898Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.01027"},"observation_digest":"sha256:1d8d0ed902ace24b5086ab74315daefd87e16860bd59a8e4ee6847b86a4ed753","observation_id":"49d26b9e-d761-4967-be0f-f5593d6b32d7","resolution":{"observed_at":"2026-06-28T17:22:24.504637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.01095","last_updated":"2026-05-31T08:35:12Z","snapshot_observed_at":"2026-08-16T02:47:38.200799Z","submitted_at":"2026-05-31T08:35:12Z","title":"Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:21:15.500408Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.01095"},"observation_digest":"sha256:05aff42170f239a3f444a1897266077f396d13f6bc0a6429143e93bd551e8854","observation_id":"ee9ffe6e-34bc-44e0-994b-e200ff4a3f33","resolution":{"observed_at":"2026-06-28T17:22:24.413659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.02274","last_updated":"2026-06-06T05:27:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T14:01:11Z","title":"Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T14:41:50.084254Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.02274"},"observation_digest":"sha256:5c505ddec12982cdb3871cba934766775fedcd8b0096926a3bd6a88c24f5e51e","observation_id":"0866c75f-eb61-44fb-a5c6-f73e10f09d6a","resolution":{"observed_at":"2026-07-01T23:06:20.428785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.02577","last_updated":"2026-06-01T17:59:38Z","snapshot_observed_at":"2026-08-13T03:35:56.388919Z","submitted_at":"2026-06-01T17:59:38Z","title":"RoboDream: Compositional World Models for Scalable Robot Data Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T14:07:31.809341Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.02577"},"observation_digest":"sha256:921532c136de2b23354d7c2a317233c66ffad4f9b885f3ae9e621ce6b2a80c90","observation_id":"47e0ba62-cfe3-4f77-8281-3863146feb2d","resolution":{"observed_at":"2026-07-01T23:36:23.584650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-12T17:23:43.880451Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:11:46.428727Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.03159"},"observation_digest":"sha256:65b1656f60197d7a29a0bcdc07af4d11a79d13c4162b422d1f7c8b4f02d95187","observation_id":"b294cd98-cc39-4856-941a-61a9052f498e","resolution":{"observed_at":"2026-07-02T02:06:27.451431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-02T12:34:17.389528Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-12T17:23:43.880451Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:34:17.389528Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.03159"},"observation_digest":"sha256:3cfcf5b65047c96d4d5be4a6f75d9abf1b88bc2b2365df02656b6008ba1e82c8","observation_id":"ba28d442-6e81-405f-8219-aa41da504410","resolution":{"observed_at":"2026-08-02T12:34:17.389528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.03943","last_updated":"2026-06-02T17:30:50Z","snapshot_observed_at":"2026-08-13T07:41:43.189636Z","submitted_at":"2026-06-02T17:30:50Z","title":"PointAction: 3D Points as Universal Action Representations for Robot Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:09:48.280446Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.03943"},"observation_digest":"sha256:a00995408019e2d0f5d88acce24e7928c5fde173e292947cc88f08ede085cf95","observation_id":"1177adce-4513-4cb5-997f-ef3e4beaeebd","resolution":{"observed_at":"2026-07-02T03:16:34.866751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.04463","last_updated":"2026-06-04T13:11:48Z","snapshot_observed_at":"2026-08-14T08:09:50.636779Z","submitted_at":"2026-06-03T05:16:41Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T06:35:26.480518Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.04463"},"observation_digest":"sha256:e3794076ccf96888d10b5c2dbab28e27b351908651636471144a9e718475107c","observation_id":"b7c62be3-a5c4-4a6c-a8f0-2cfdb861045b","resolution":{"observed_at":"2026-07-02T07:56:47.049610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.08737","last_updated":"2026-06-07T17:18:23Z","snapshot_observed_at":"2026-08-15T23:36:43.154375Z","submitted_at":"2026-06-07T17:18:23Z","title":"Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:17:06.288698Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.08737"},"observation_digest":"sha256:fb1156ae042511c69d3a3482d8a7cc7af9f8a3b78fdca2cb6c9cb80e4a16614c","observation_id":"5a214f1b-b761-493a-8343-d66e691ec6f6","resolution":{"observed_at":"2026-07-02T23:27:26.854388Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09215","last_updated":"2026-06-08T08:50:14Z","snapshot_observed_at":"2026-08-13T04:21:12.437209Z","submitted_at":"2026-06-08T08:50:14Z","title":"MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:25.136391Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09215"},"observation_digest":"sha256:e303b5f31316516c63a65ccfc2df741246ee0c9d2c264796fa8bd16856a1977e","observation_id":"26aa952f-0ba2-47d9-ab50-2cacda776694","resolution":{"observed_at":"2026-07-03T01:37:30.721968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09499","last_updated":"2026-06-08T13:50:31Z","snapshot_observed_at":"2026-08-13T18:45:04.381105Z","submitted_at":"2026-06-08T13:50:31Z","title":"Targeting World Models to Compromise Robot Learning Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:05:01.264700Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09499"},"observation_digest":"sha256:dc2702b9b77777bd87a650d5c3cd1c48ced92e9c404e2d03bc082a37d03c3d14","observation_id":"b27474e3-af7a-4011-9ae8-ecbb0a44072b","resolution":{"observed_at":"2026-06-27T16:41:03.690648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09507","last_updated":"2026-06-08T13:59:50Z","snapshot_observed_at":"2026-08-14T10:19:53.446609Z","submitted_at":"2026-06-08T13:59:50Z","title":"Prisma-World: Camera-Controllable Multi-Agent Video World Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T17:03:29.676482Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09507"},"observation_digest":"sha256:dfc903c9e829b9c38b89c729de6a76522a2f7bb2664d20a1578170aebcfa0a7b","observation_id":"8485be8d-3234-48c7-9d2e-6114cd9a9e1a","resolution":{"observed_at":"2026-07-03T00:47:30.157870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-08-12T22:21:00.037802Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:31eefdf04cb577de3157b10b62a9237c45f49b44718b20510a83e8481c8c7090","observation_id":"e6590b4a-8ccb-4bc7-bf74-c81556e78738","resolution":{"observed_at":"2026-07-03T00:57:29.762501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09827","last_updated":"2026-06-08T17:59:53Z","snapshot_observed_at":"2026-08-02T03:40:52.111546Z","submitted_at":"2026-06-08T17:59:53Z","title":"MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T16:13:19.238535Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09827"},"observation_digest":"sha256:1f337a1026970aec2852125eaff7c1313413df862b02b745a8cb3c40d8d8a44a","observation_id":"decda045-f23d-4377-8905-fc6f7ecfd57a","resolution":{"observed_at":"2026-07-03T01:57:32.223652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.10276","last_updated":"2026-06-09T00:50:29Z","snapshot_observed_at":"2026-08-15T17:22:27.752672Z","submitted_at":"2026-06-09T00:50:29Z","title":"Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:02.640975Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.10276"},"observation_digest":"sha256:b235d8f159838e8c1fa3b2c5f69e795c09fac90006634214e260c95d4c4d02df","observation_id":"8e9fe27f-cdae-47c3-a8db-356965475274","resolution":{"observed_at":"2026-07-03T04:57:38.603718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.10656","last_updated":"2026-06-09T10:04:38Z","snapshot_observed_at":"2026-08-16T03:11:14.812789Z","submitted_at":"2026-06-09T10:04:38Z","title":"Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T13:48:15.379724Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.10656"},"observation_digest":"sha256:f892dbe34d9afe18084fde63fec67fb2fc07caf120be0cfd01636093350358ca","observation_id":"bb4167c1-d3f8-43e7-8d01-f4cdd868012f","resolution":{"observed_at":"2026-07-03T04:37:36.898884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-08-14T19:43:16.696160Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:025dc019f64b905d44ddd99b3839cf3152c8ff46ffabb6ba7a960360c52cdda9","observation_id":"7e5f1ff1-3baf-4992-b0b3-3dc0fbbafba8","resolution":{"observed_at":"2026-07-03T05:47:41.258522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.12403","last_updated":"2026-06-10T17:59:08Z","snapshot_observed_at":"2026-08-01T17:35:24.729614Z","submitted_at":"2026-06-10T17:59:08Z","title":"World Pilot: Steering Vision-Language-Action Models with World-Action Priors","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:02.137152Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.12403"},"observation_digest":"sha256:8011c0463abdd3969755a4688ca41f214296101b7ff8f817777e79ea345d23cc","observation_id":"db0b85f4-8434-45ba-a162-ce39c96f6224","resolution":{"observed_at":"2026-07-03T11:18:03.367479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-13T22:58:06.874802Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:47:05.236028Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.13674"},"observation_digest":"sha256:23906493ea9a4dc1872a96823c07dff4ce8726ab43e58ab1bddac0e66624c02e","observation_id":"f712b579-d06a-42cb-a67e-fab5be5b2317","resolution":{"observed_at":"2026-07-03T14:58:33.402657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.16776","last_updated":"2026-06-28T12:48:48Z","snapshot_observed_at":"2026-08-14T09:08:01.324910Z","submitted_at":"2026-06-15T14:21:35Z","title":"JoyAI-Sim: A Simulation-Enabled Interconversion Toolchain for the Embodied Data Pyramid","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:31:54.292897Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.16776"},"observation_digest":"sha256:e65633047187c22ac7f3b03b32854062960855d9e9e975963659fda074ce998e","observation_id":"07740f9e-264d-4bb3-9d19-d02040054ca3","resolution":{"observed_at":"2026-06-30T10:34:36.285000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.16917","last_updated":"2026-06-20T01:31:21Z","snapshot_observed_at":"2026-08-15T04:36:39.265813Z","submitted_at":"2026-06-15T16:23:42Z","title":"Unified Motion-Action Modeling for Heterogeneous Robot Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T04:09:06.885372Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.16917"},"observation_digest":"sha256:ba44e8c893b1c332605243b8f84869fcb8925f48db51652d13b0e75d5e0d4fa8","observation_id":"ea456dda-ca92-4b09-b322-d91e83309386","resolution":{"observed_at":"2026-07-03T17:28:44.450366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18375","last_updated":"2026-06-23T16:50:09Z","snapshot_observed_at":"2026-08-12T21:34:06.540989Z","submitted_at":"2026-06-16T18:23:23Z","title":"PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T00:19:33.170645Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18375"},"observation_digest":"sha256:70b5712b08983fd0f995a1793c467f65f38c91a42b359a115d0a1e4176f615b8","observation_id":"a0374d14-7131-4951-9926-ab50da5b3f6f","resolution":{"observed_at":"2026-07-03T21:38:58.746884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18478","last_updated":"2026-06-23T08:04:55Z","snapshot_observed_at":"2026-08-12T14:25:41.973183Z","submitted_at":"2026-06-16T20:38:30Z","title":"Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T00:55:20.691480Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18478"},"observation_digest":"sha256:5424027533b724df5d56eb4619c5507b83cd1836befe9de6e55cf1064bd9b9a4","observation_id":"53cf68d8-2acc-4d4f-96d2-9a873d364131","resolution":{"observed_at":"2026-07-03T21:08:58.095744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-08T09:10:50.377259Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:18:07.494794Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18610"},"observation_digest":"sha256:6d20682751757b20b89edaf52e4184120084c49a747ce0f3c0d2115aa5f36f1b","observation_id":"f2a039eb-731e-4d73-81c0-460d909bde03","resolution":{"observed_at":"2026-07-04T00:19:13.396326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-08T09:10:50.377259Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:30.594399Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18610"},"observation_digest":"sha256:4075937658dd143b54facb4286864d11e57c2c565db1bd56a07c23ebf440c4ba","observation_id":"43ee7b49-2995-4cb3-8038-0041d7dca188","resolution":{"observed_at":"2026-06-29T18:23:51.418723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18960","last_updated":"2026-06-18T07:33:11Z","snapshot_observed_at":"2026-08-01T14:33:56.926730Z","submitted_at":"2026-06-17T11:42:00Z","title":"Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T21:50:26.223702Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18960"},"observation_digest":"sha256:474333de2fd884b7c5d0c18a4712d4b9c61160b095c4a00cb6be759d184d8fe4","observation_id":"fd63755f-e389-441f-af67-1969f010d5ae","resolution":{"observed_at":"2026-07-03T23:39:04.851790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.19836","last_updated":"2026-06-18T06:28:33Z","snapshot_observed_at":"2026-08-15T03:59:39.967375Z","submitted_at":"2026-06-18T06:28:33Z","title":"World Engine: Towards the Era of Post-Training for Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T17:21:15.456982Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.19836"},"observation_digest":"sha256:98091c30a6cb71eade34ff2ba869433eeef8eeb65b788eadafa92eabcb6d527d","observation_id":"0186237b-8460-4fd2-ac03-af8946a85dba","resolution":{"observed_at":"2026-07-04T03:59:33.870765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.20867","last_updated":"2026-06-18T18:54:51Z","snapshot_observed_at":"2026-08-03T13:52:03.831619Z","submitted_at":"2026-06-18T18:54:51Z","title":"FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:08.616612Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.20867"},"observation_digest":"sha256:8c9c0d87d09c4461e945deb8b9b4222d0b1b5c7b5ab8af9d8331771f5b67d052","observation_id":"143010e0-b851-4b85-8b31-7d2f1e0053cc","resolution":{"observed_at":"2026-07-04T03:29:30.391838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.23085","last_updated":"2026-06-22T09:32:28Z","snapshot_observed_at":"2026-08-13T18:22:56.882527Z","submitted_at":"2026-06-22T09:32:28Z","title":"Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T08:43:06.983870Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.23085"},"observation_digest":"sha256:fc2ed72fe87ef99156bbe4fc6720a9c8b968d51d2c0b74511bb955688a4c6b63","observation_id":"f6cfe78c-ec3b-4456-92f7-a7984f1a9b44","resolution":{"observed_at":"2026-07-04T10:39:44.765169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.24597","last_updated":"2026-06-23T13:53:55Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T13:53:55Z","title":"Qwen-AgentWorld: Language World Models for General Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:31.403419Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.24597"},"observation_digest":"sha256:6ee9d26df42b7cd1ff1bf714897ef6c306e9422ba1391028381d3420556eeb73","observation_id":"c884a9f7-45c6-4d56-a02b-b543c1a27859","resolution":{"observed_at":"2026-07-04T17:09:59.232510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.25306","last_updated":"2026-06-24T02:12:54Z","snapshot_observed_at":"2026-08-13T15:27:36.970804Z","submitted_at":"2026-06-24T02:12:54Z","title":"Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:33:38.643889Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.25306"},"observation_digest":"sha256:b4bb2fc732aa1ed23ce6a9aeb74d9a33f8f9d11d653f325d14ae965a9df364ea","observation_id":"345b4521-a0b1-4df9-9d05-5040bfd2a2a2","resolution":{"observed_at":"2026-07-04T19:20:05.904375Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T20:57:30.765802Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.25473"},"observation_digest":"sha256:6f203ae2c204d3be532354f1c4d655292a18a9d98681b412e2bb73203ce36639","observation_id":"2e214b17-4e5c-4ee0-8ac1-1fa7967f7900","resolution":{"observed_at":"2026-07-04T19:50:11.367469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.00062/citation-record","integrity":"/paper/2511.00062/integrity","json":"/paper/2511.00062/citation-record.json","paper":"/paper/2511.00062"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:713645750ea5dd426091884dbdb1bea03b36b1c0fe781d2e23a9389b3a170e7f","observation_id":"ab3cb743-68a0-4ace-b948-d3a1d9d89180","resolution":{"observed_at":"2026-05-12T23:01:13.764797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07126","last_updated":"2024-11-11T16:58:31Z","snapshot_observed_at":"2026-08-12T22:03:10.373420Z","submitted_at":"2024-11-11T16:58:31Z","title":"Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models","version":1},"cited_work":{"arxiv_id":"2411.07126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07126","snapshot_observed_at":"2026-07-03T00:47:30.400558Z","title":"Edify image: High-quality image generation with pixel space laplacian diffusion models","venue":null,"work_id":"e07c55c7-533e-4182-9a44-b5440d29a1f4","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2411.07126","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:115e3405ff0373e66f46bded39d35629427ca4a4879dc0ae79575b26d65e5b72","observation_id":"412f4703-524d-4c24-8067-82cce219e50b","resolution":{"observed_at":"2026-05-12T23:01:13.610147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":"076c0ed8-f450-40bf-b786-ad44de304ce4","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ff578e45b5e80f1dd8368b9ad569668e1645d59e17a5896ae44332e9bbe44be9","observation_id":"8d4e97d9-0307-45a8-9a93-615803083ce8","resolution":{"observed_at":"2026-05-12T23:01:14.114818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints","venue":null,"work_id":"fcb2c846-859e-4a19-9871-1d6a96f68bcf","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:959c34fdcd8b5227542776d7f01feb10554f486f639625bae456e3b4bfaf3b16","observation_id":"05cfa97a-37d4-47f8-a963-f576c59a03bb","resolution":{"observed_at":"2026-05-12T23:01:14.080265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:40c72d21fd176a3b0ea5c980c46d2d741e903e85da627eb75f1e026423486a0c","observation_id":"8ad112cd-35b9-4b7d-9eab-055948c21a6f","resolution":{"observed_at":"2026-05-12T23:01:13.900179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genie 3: A new frontier for world models","venue":null,"work_id":"5a803ce9-58b1-4758-8505-3a00eb7bd924","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:07fe33f952308be0191ffc9b7ec0ec4f139476828425b8dac0cf96da2123c26f","observation_id":"8c71e354-e252-43f9-8c9c-d59d67da6b9d","resolution":{"observed_at":"2026-05-12T23:01:14.090308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:9f63a7acac265553aa85b4e84fd4e156d86550e59a4aa8d35a286711d116e1bb","observation_id":"c17a0f9c-3cfe-4b8b-a98d-f1dec6f899ab","resolution":{"observed_at":"2026-05-20T11:34:37.994076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-11T04:03:22.760457Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3e3b9e53a2bdfac27c460535eae98426815866ec6a748baf58518fdfebd0fd8c","observation_id":"feea1a15-9db2-4ab4-8253-1d0e571742b9","resolution":{"observed_at":"2026-05-12T23:01:13.918325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f89edb5d9e0ce75b3ca9459569b64170d47cbf2f17e8f7f0177da308aeb4796a","observation_id":"8b76e304-375e-4841-a6bc-bf9387a2be39","resolution":{"observed_at":"2026-05-12T23:01:13.924336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08f855be-6874-4841-9904-e5951484b5c5","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:5ec5a593acb69fd8912aca1204769cd9ec94d9964c0c9f9511347c9e13fda695","observation_id":"87aa9c59-6556-4152-a084-af0d4e6de054","resolution":{"observed_at":"2026-05-12T23:01:14.108994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09849","last_updated":"2025-06-11T15:21:16Z","snapshot_observed_at":"2026-08-12T15:10:44.435246Z","submitted_at":"2025-06-11T15:21:16Z","title":"IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments","version":1},"cited_work":{"arxiv_id":"2506.09849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09849","snapshot_observed_at":"2026-07-04T13:59:51.797306Z","title":"Intphys 2: Benchmarking intuitive physics understanding in complex synthetic environments","venue":null,"work_id":"6a27c357-5d91-401c-a3ad-3d9afc4b6f93","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09849","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:740ccf821a5cea2ed85ffe4a2a78edc0311877b5980f95d95e68f84435f21c51","observation_id":"d5e3258f-1975-43a1-a456-a2d2404812eb","resolution":{"observed_at":"2026-05-12T23:01:13.930429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":"8e18ab1c-eef4-4b38-8997-f1e406b3c669","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f61aaf1c4dbaa7e52466f7c2eeb9e5b45908c4d62c9d4b8db6d1a7d1734c21d7","observation_id":"be046de4-45a5-4780-8d99-c997383fe7c2","resolution":{"observed_at":"2026-05-12T23:01:14.120244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02722","last_updated":"2025-09-06T21:02:02Z","snapshot_observed_at":"2026-08-15T09:22:30.087238Z","submitted_at":"2025-09-02T18:18:57Z","title":"Planning with Reasoning using Vision Language World Model","version":2},"cited_work":{"arxiv_id":"2509.02722","doi":"10.48550/arxiv.2509.02722","metadata_source":"pith","pith_arxiv_id":"2509.02722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Planning with reasoning using vision language world model","venue":"cs.AI","work_id":"d7796b30-bd03-428f-8b12-48656aa8122d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2509.02722","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:048f81acdf316f47bfde1ac362d1248ccf240e502a1e7fe440a7045b431d8a82","observation_id":"78979042-1691-4b31-97a4-7a2df6df84a2","resolution":{"observed_at":"2026-05-12T23:01:13.939379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video depth anything: Consistent depth estimation for super-long videos","venue":null,"work_id":"53a5e6fb-a98b-4a7c-84c1-5fe7305c7b64","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8e6d9d1a343066df4e1d267df83b547f0d72116904ab1787cd05cd8e048bcec3","observation_id":"b4249491-da51-4d0b-938f-825a0180ee23","resolution":{"observed_at":"2026-05-12T23:01:14.130867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-08-14T17:24:49.885507Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":"2301.10972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-07-07T18:04:00.522746Z","title":"On the importance of noise scheduling for diffu- sion models","venue":"cs.CV","work_id":"1783cbc7-505c-4ebc-82f3-86877ef131b3","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8881e302beb10715d7b4b0ec8d760d6e59ea4c82460515f2a7c8b176c57cd4a5","observation_id":"b2e3c0e0-06c0-4587-9278-38e3d2fc6054","resolution":{"observed_at":"2026-05-12T23:01:13.947275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"eae6459f-9b68-4499-a871-c018c823b169","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ff7563dc94303057c9d5e66dee7bb671f4740b272850cfd48048fa26b1c5c544","observation_id":"55b562ef-1d13-4b22-996a-c77360e10b06","resolution":{"observed_at":"2026-05-12T23:01:14.152163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delta lake: Open-source storage framework that enables building lakehouses.https: //delta.io/","venue":null,"work_id":"ca99e590-7c1f-4304-a6f4-e9c12f0a962f","year":2019},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3d540c7c281ae64040d269828c4aa761ca8a506bee6dcc15039f3e74cf0ea1f3","observation_id":"9458ccae-8aac-41b5-afea-ceabf2f6645d","resolution":{"observed_at":"2026-05-12T23:01:14.158787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 3, 5 2025","venue":null,"work_id":"f010392a-c2a5-4304-be0a-f21838da9360","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8c2eb75957ade3096af4ead690054d2b60cc26dfc0c84ab326ad67425a6f9d24","observation_id":"49a52bbf-cba0-4db8-bdb9-078863bdba7e","resolution":{"observed_at":"2026-05-12T23:01:14.163715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.342857Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":"ad14fa35-72b1-4530-b01a-6d41cd35888d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:bbfc6598491effb02cf063524f7a9708c571bb2ff0b358b249b8e0f6991e179a","observation_id":"c29ec697-2aeb-436e-ade5-3d8d1c0c930d","resolution":{"observed_at":"2026-05-12T23:01:13.954077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"a1cc3423-ef62-40cc-87ee-603d95f695d4","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a61350948e3dd2b7fb0b23c2c19119efc99f5b45c545a573d7369ec6cf777fde","observation_id":"29ff6d43-a026-4531-8901-be2947ef9b2f","resolution":{"observed_at":"2026-05-12T23:01:14.176994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01264","last_updated":"2026-04-12T14:54:50Z","snapshot_observed_at":"2026-07-06T21:50:49.929005Z","submitted_at":"2025-07-02T00:45:19Z","title":"LLM-based Realistic Safety-Critical Driving Video Generation","version":2},"cited_work":{"arxiv_id":"2507.01264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01264","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM-based Realistic Safety-Critical Driving Video Generation","venue":"cs.RO","work_id":"41c6faf7-7a34-407b-ac44-574ec266b047","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2507.01264","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:aa4931974d7375c82f999b0d95f665040099205d34ba701973655dc9fc13ecc4","observation_id":"3464cb8c-58e6-4fa1-906f-ac882462c28b","resolution":{"observed_at":"2026-05-12T23:01:13.962088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models and gaussian flow matching: Two sides of the same coin","venue":null,"work_id":"1183fac1-6a1c-42d6-9ee0-6773330322c1","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:337b9064936cc324209dc712d318a5e00cd165f660b474758ff31be9a5109d82","observation_id":"1f8223a3-7728-4dc5-845a-deb5eb77378a","resolution":{"observed_at":"2026-05-12T23:01:14.195347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-09T02:36:54.979612Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:afdd27d17c95098f3a9e8181d56f48617cd07a57eb540de665c4a140703dba49","observation_id":"edea4d0f-8dc8-424d-9fcb-f19dc243d1b4","resolution":{"observed_at":"2026-05-12T23:01:13.971409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08430","last_updated":"2021-08-06T03:22:14Z","snapshot_observed_at":"2026-07-06T11:30:06.143581Z","submitted_at":"2021-07-18T12:55:11Z","title":"YOLOX: Exceeding YOLO Series in 2021","version":2},"cited_work":{"arxiv_id":"2107.08430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.08430","snapshot_observed_at":"2026-07-04T19:20:06.601231Z","title":"YOLOX: Exceeding YOLO Series in 2021","venue":"cs.CV","work_id":"112b3cd9-8fe6-49fe-bbaa-90a3f46045c7","year":2021},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2107.08430","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c070a87a85bcf598ad1cfd9fb830c0379bd4b1aa7da2979876673cd7060145bd","observation_id":"eaa9cbc9-f6d9-4048-9310-6e68115ac020","resolution":{"observed_at":"2026-05-13T10:31:31.716715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8dbd4f72f99b4124c8488df31c57903d45661a2cce81603316826c0aa09bac23","observation_id":"3dadca2a-d312-45cb-9b6f-62d0f3855602","resolution":{"observed_at":"2026-05-12T23:01:13.986635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00337","last_updated":"2025-05-01T06:34:55Z","snapshot_observed_at":"2026-08-11T00:38:57.351139Z","submitted_at":"2025-05-01T06:34:55Z","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2505.00337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00337","snapshot_observed_at":"2026-07-04T13:59:51.792842Z","title":"T 2 V P hys B ench: A first-principles benchmark for physical consistency in text-to-video generation","venue":null,"work_id":"8e0819a9-997f-40ad-9d64-220808cd9d4c","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.00337","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4fb688796001c9cbcd8c9502705e63df7556750c60cdb020c52608635af6df27","observation_id":"8dc1b711-ac24-4cf6-b365-8735ce972af6","resolution":{"observed_at":"2026-05-12T23:01:13.994170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-15T13:04:28.651186Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:161e98484a9c28347921e68f77832abb1d79fd5fe6a0341f1811b6ac1a7ccfda","observation_id":"f99882ba-cb42-46ea-9153-109dca9c5367","resolution":{"observed_at":"2026-05-12T23:01:14.002924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:6e700aa1800f6cc2b1a8d9968c1e1ce16890cfc6ac561c9d7977fec07a1fd98a","observation_id":"906f848f-38b0-44f0-99bf-c1808cfbddd3","resolution":{"observed_at":"2026-05-12T23:01:14.011752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-15T17:22:37.525122Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a0786f6e9ce2c11a2e8a449cd909f28e10bca88c78327b3c2b2f32ddc29f58eb","observation_id":"4a1f96cd-9daa-47a3-b344-64bcabdb5e9f","resolution":{"observed_at":"2026-05-12T23:01:14.018849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16922","last_updated":"2025-04-23T17:49:53Z","snapshot_observed_at":"2026-08-13T08:58:27.010977Z","submitted_at":"2025-04-23T17:49:53Z","title":"Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light","version":1},"cited_work":{"arxiv_id":"2504.16922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16922","snapshot_observed_at":"2026-06-28T22:32:44.088180Z","title":"Generalized neighborhood attention: Multi-dimensional sparse attention at the speed of light","venue":null,"work_id":"80ac4f09-67cb-4ef2-b433-8867df8e43b6","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2504.16922","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:e4ed91d3d71d5c2159f1dfefff304ac693ad8d51b7269c94dea5f8f11ced3be3","observation_id":"aa7ef977-8a45-4454-abc7-f06974e97305","resolution":{"observed_at":"2026-05-12T23:01:14.026420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15673","last_updated":"2025-06-18T17:56:45Z","snapshot_observed_at":"2026-08-15T20:00:23.664051Z","submitted_at":"2025-06-18T17:56:45Z","title":"UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting","version":1},"cited_work":{"arxiv_id":"2506.15673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15673","snapshot_observed_at":"2026-07-04T13:09:50.468291Z","title":"arXiv preprint arXiv:2506.15673 , year=","venue":null,"work_id":"eb06501a-2d45-43ae-994e-95e15886779e","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.15673","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:76d47247e6ac2774b7ba495b74897d5e41f485668e4b74ff48f60b715a8264ec","observation_id":"1aac1657-8923-4a1e-9f87-cc03d0c41c31","resolution":{"observed_at":"2026-05-12T23:01:14.035929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"7f92bfbe-a72f-4f7f-a8c1-c75dca2a6681","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4b8e909cdb444a062ed76dd30ddac6083cfb682f4e6de329f4bbd5e3dc493bd3","observation_id":"cd329c03-ce76-45d0-9f9d-4782b071fd88","resolution":{"observed_at":"2026-05-12T23:01:14.264196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-08-14T06:25:22.731553Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":"2508.10934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-07-04T13:29:51.199853Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","venue":"cs.CV","work_id":"2d60e542-3c1c-4656-becc-ded522856631","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:52050f85b21c2dd800b57585ff05358ed3472ff50a9d2f324866552bbbd3c577","observation_id":"f9dcd7e3-e2e4-4e43-8037-dba17d16ab2d","resolution":{"observed_at":"2026-05-16T16:41:08.910540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07705","last_updated":"2024-05-03T19:00:47Z","snapshot_observed_at":"2026-08-13T15:23:14.305851Z","submitted_at":"2022-06-15T17:57:41Z","title":"LET-3D-AP: Longitudinal Error Tolerant 3D Average Precision for Camera-Only 3D Detection","version":2},"cited_work":{"arxiv_id":"2206.07705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.07705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let- 3d-ap: Longitudinal error tolerant 3d average precision for camera-only 3d detection","venue":null,"work_id":"533225e8-40c3-463d-a3d9-5171e9b4ad1e","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2206.07705","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7a02e8b53a9f521bc643bec11f067ada49b5a6c0c7b77546d3e2c121fff942c6","observation_id":"3842889c-98aa-432d-93c6-397d01e3b08f","resolution":{"observed_at":"2026-05-12T23:01:14.050176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c6eb35c0f12d3e7a59308093d134f1f399d4529c50b3e39b48cc6d9efc976cd3","observation_id":"d4e9e9b6-b193-4e97-8800-42732f720e3e","resolution":{"observed_at":"2026-05-12T23:01:14.056202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":"2505.12705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-07-10T12:47:05.582841Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","venue":"cs.RO","work_id":"8f44bbac-2812-4198-83bb-f6c857664a1d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:e6e5d74fca2f8808b138240dcade9e09e660df618973f68fa7c9d93a390f6090","observation_id":"284aa987-6557-4fc1-aa91-dcc35acd264d","resolution":{"observed_at":"2026-05-15T23:50:45.800685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07399","last_updated":"2023-07-03T03:06:26Z","snapshot_observed_at":"2026-08-15T07:12:53.613623Z","submitted_at":"2023-03-13T18:26:11Z","title":"RTMPose: Real-Time Multi-Person Pose Estimation based on MMPose","version":2},"cited_work":{"arxiv_id":"2303.07399","doi":"10.48550/arxiv.2303.07399","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.07399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rtmpose: Real-time multi-person pose estimation based on mmpose","venue":"arXiv (Cornell University)","work_id":"faecd514-b825-469e-913e-4715dc3737f2","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2303.07399","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0b75884c7f72a23522e541801c4ce521a79d115d5f84fb5320b06a36b84dc163","observation_id":"f0765cd3-e892-4bbe-9d26-fa149d80302a","resolution":{"observed_at":"2026-05-12T23:01:14.070641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elucidating the design space of diffusion-based generative models.NeurIPS","venue":null,"work_id":"0640b49e-fbce-4909-a5c8-34a4c2e1ec83","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:9d668dae599246484874de6709e60f4d01825f4d6cedd9c809657b25051002ec","observation_id":"6dd5d3a1-74ef-486c-b209-98da15fff0a2","resolution":{"observed_at":"2026-05-12T23:01:14.304402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8965438b85b7eb2e03cf8ada6eaa46b1a9c12a8c69c5f3b0807df19f514af5da","observation_id":"3537471d-bbb2-4c45-8296-29eb79762abc","resolution":{"observed_at":"2026-05-12T23:01:14.075355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:db4f8ff1c09292b6f750ae5e51d63ce88044d06ba19ef03eae2b26d0e354ed37","observation_id":"665fad89-9f5f-469c-a9e5-a035537641f5","resolution":{"observed_at":"2026-05-12T23:01:13.624574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling","venue":null,"work_id":"9a20e5b1-dc8e-4495-bde2-7f3c6c7495b2","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3f1bb71a59022cbd4b3105099b638fbea7bf371e1f2934342480f7bbe032a146","observation_id":"b29f4ddb-f6b4-498a-9da7-c2e97480c021","resolution":{"observed_at":"2026-05-12T23:01:14.321923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-08-13T16:10:42.745158Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:dd08ba99d8acb67ba42ae214ff7b369053dc4de9f9617f7eefcbd753247ee626","observation_id":"f2ee8ce3-f025-44bc-a2cf-8780d356ba4e","resolution":{"observed_at":"2026-05-12T23:01:13.632850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:44.719370Z","title":"Won- derplay: Dynamic 3d scene generation from a single image and actions.arXiv preprint arXiv:2505.18151","venue":null,"work_id":"5fc82e3e-ec7c-4c0f-8e8e-245be42bc9cd","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:11f364a9e992e42ece1ef8302b77b09d3958d73049e6a46d65cbfef67dfe94d5","observation_id":"5b6e1514-92d1-45c1-ada2-7903ddd6408a","resolution":{"observed_at":"2026-05-12T23:01:13.639296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":"028d295a-e1da-4218-97cc-bbacbae5e467","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7b282f4a42174a45432cef5ffed3e10d2a1abf30f2ed6957f152e1655c5253ab","observation_id":"cbcafa83-5f1e-4391-ab60-06f49959080b","resolution":{"observed_at":"2026-05-12T23:01:14.099057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ca6591fe42f764af36d22133ac6dda27931f95ab352d58c9d5c4ad238412a61c","observation_id":"8dd4a2d0-814a-4cef-b4ad-421c3dd83fff","resolution":{"observed_at":"2026-05-15T21:28:42.077022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:523d758211dacd54d1466d7ad94809909c2218249ee71bb785a2c58a717772ca","observation_id":"adbef28e-01d6-4b66-b831-e5918f9aadb2","resolution":{"observed_at":"2026-05-12T23:01:13.653660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c7f9a97f56bdde64815a9b83904e2866c6c31e19361c3aab2c706587001d65e3","observation_id":"44d2be4c-486d-448f-9aa2-ea991d47a487","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicscaler: Seamless and scalable video generation for panoramic scenes","venue":null,"work_id":"c273494c-f325-4031-a5a3-8c378a429f96","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ee7e47fa36569a0acd40ba4750d7f52e1b3d48463f5c07956f0ba108a50700b8","observation_id":"f99bbb63-c9bd-4b33-aa44-b2e411deb33e","resolution":{"observed_at":"2026-05-12T23:01:14.138025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:5a534f115cdf40b8f4b9654ce70c93ee19fe1471c25209f0c7934d9f45e7f333","observation_id":"08efc4e9-13c8-481a-aca0-8d5367ee7e4b","resolution":{"observed_at":"2026-05-12T23:01:13.667121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-08-14T10:36:46.717239Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":"2410.11081","doi":"10.48550/arxiv.2410.11081","metadata_source":"pith","pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","venue":"cs.LG","work_id":"1151c0b6-2be7-436c-ab83-843d92dea769","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:025888d6df741098fb022872fe5ec001ee9a00422217b5482f83fa744fa0e02d","observation_id":"fd492237-9055-48ba-a752-7c5e6a233445","resolution":{"observed_at":"2026-05-13T10:26:23.772771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:52.637926+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:52.637926+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04583","last_updated":"2023-08-20T13:31:54Z","snapshot_observed_at":"2026-08-15T03:05:35.598142Z","submitted_at":"2023-08-08T21:08:42Z","title":"LATR: 3D Lane Detection from Monocular Images with Transformer","version":2},"cited_work":{"arxiv_id":"2308.04583","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04583","snapshot_observed_at":"2026-07-02T02:06:27.410680Z","title":"Latr: 3d lane detection from monocular images with transformer","venue":null,"work_id":"93c472e8-e769-4490-8149-441232b7649c","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2308.04583","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2d799ce5eab58d7eff6720a43c4d0fa791bc80488212d868ce021482609ea331","observation_id":"ef66dd02-13ac-41d7-9beb-570513e9222e","resolution":{"observed_at":"2026-05-12T23:01:13.682645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hailuo","venue":null,"work_id":"dfcb2817-b34f-4c84-9e43-d7f451185f00","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:58a5b4e096eac7c6c8c1ebc85aaae12da5de1df38ce47899528d4088f1d3dc9c","observation_id":"e9e99ea9-b2e0-4f61-a539-5affb253ebf9","resolution":{"observed_at":"2026-05-12T23:01:14.206489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-14T09:57:44.505326Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":"2501.09038","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-07-07T15:43:53.802817Z","title":"Do generative video models understand physical principles?","venue":"cs.CV","work_id":"d9132ccf-02ed-4700-bf79-4e874794600d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0a5257f11c29f84149c494fa742fba756306a70f5026811260793053f8807738","observation_id":"b073b607-1fdc-4a9e-a313-abd9b69fd17e","resolution":{"observed_at":"2026-05-20T12:47:06.031259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-14T15:33:08.751931Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":"2406.02523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-07-11T02:27:48.956741Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","venue":"cs.RO","work_id":"11232b35-bd17-402a-9234-951c46015815","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1e84ad18c4d7d361bdc9a27b476dee6ec7d84c40009056217bca65533f3d7c58","observation_id":"edf2c7b8-8352-4d53-ba76-1603399fd485","resolution":{"observed_at":"2026-05-12T23:46:30.425882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":"2503.15558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-07-05T11:41:02.557688Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","venue":"cs.AI","work_id":"09215448-e68a-4168-89b7-9d9a83a0e51f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:6a72b91060efb5dbdf0db5bbc97cadd151b7d6b62869c9616e3a31ce9f33236e","observation_id":"32f39998-bff7-4dce-8971-8a381add6192","resolution":{"observed_at":"2026-05-16T12:47:10.348602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-08-12T04:49:11.105944Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3c3f9ac9a23b40bdbe2984c0dcea165bd91588914f989005b6346261c952e076","observation_id":"f344ecf1-a33d-49c0-8634-5443f93647f8","resolution":{"observed_at":"2026-05-12T23:01:13.712342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2f3f44028fe4e1dc58d7b38db46d9c4190297c360a4763c8a0a31c582075f350","observation_id":"6f8d0196-3608-45c3-a9f9-cdf0d070daea","resolution":{"observed_at":"2026-05-12T23:01:13.716640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e1b64f36-98d7-4b56-9018-7024c7bed748","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:d7ac4884647e8bc7a0b63a575e367cc1142bf2246d59bf0321b89919c07a4e72","observation_id":"ba398b82-ef48-45ec-8759-07d233eea72d","resolution":{"observed_at":"2026-05-12T23:01:14.248509Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora","venue":null,"work_id":"9f34eff5-7a40-403a-ad04-f983457d603b","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:26af796584c40966cff75f1fe593030c0a6d0de9b8d4727af503947bd6e54dd4","observation_id":"89c3a877-9d7f-402b-9b79-fefb1ab37802","resolution":{"observed_at":"2026-05-12T23:01:14.256392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.NeurIPS","venue":null,"work_id":"1387d197-97a7-4078-a987-ba844a834819","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:75967ed92cda07e7952a07edd470adb273273a72efb33265a8074abba0460ea6","observation_id":"2ee28bcd-8222-4143-82a5-fe69c5d9dabd","resolution":{"observed_at":"2026-05-12T23:01:14.269581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2d43830c75ff79465f6ed5e3c381f49da76fea0a43e84d3432009976fbb8a731","observation_id":"19018ce4-6981-4d95-9720-68469fb6f6d1","resolution":{"observed_at":"2026-05-12T23:01:13.721168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f149d76556026c5102fe99e0a8f7d75f8d64e4110d5a242dba1a6481593ba37a","observation_id":"74b9026e-75e5-420d-80d1-c74b354abed5","resolution":{"observed_at":"2026-05-12T23:01:13.725884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"54486b12-8397-4460-9618-5cbebb6d5a3d","year":2020},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c4de40e8d3205d498c7b34da8048e40d5bb18c9769a6591a6448cd48a54a757d","observation_id":"a2727a34-99a7-459f-adef-a336243af3b0","resolution":{"observed_at":"2026-05-12T23:01:14.287690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:6384728dcb0c16dc1ed655458ca2ae9c21b6c17f569d36c84080e6e8d11d6c36","observation_id":"66e125d8-e0fc-4ea1-8ee6-072a45efb597","resolution":{"observed_at":"2026-05-12T23:01:13.730843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ren, Justin Lidard, Lars Lien Ankile, Anthony Simeonov, Pulkit Agrawal, Anirudha Majumdar, Benjamin Burchfiel, Hongkai Dai, and Max Simchowitz","venue":null,"work_id":"453a2664-e4b7-49db-8ec4-1dc9f0b99158","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:23dfcf1027838409af2db0fde96f8743215ae3006cb04b17918fa0f0903082fb","observation_id":"95d616d7-bd92-46a3-b35c-e77a2a868564","resolution":{"observed_at":"2026-05-12T23:01:14.310856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":"2401.14159","doi":"10.48550/arxiv.2401.14159","metadata_source":"pith","pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","venue":"cs.CV","work_id":"42c46ece-c4e8-4d5e-abae-f8d5b4208995","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7bc4408054cbc181b4cdcc49105f7aa35a593c560f1908c0fd89175025741601","observation_id":"283d1d9f-ef01-48eb-b6ed-3b806058b365","resolution":{"observed_at":"2026-05-12T23:01:13.736123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-07T04:54:23.914784Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.09042","doi":"10.48550/arxiv.2506.09042","metadata_source":"pith","pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":"cs.CV","work_id":"af51168b-8b82-45d2-bf85-e3d07f99492b","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:5dab68830bf0bdafaf08071bcc851a74aab3783322cfa1fdbc8b6555e950423c","observation_id":"32c4917d-c431-423f-97c5-4237fd9f6cbc","resolution":{"observed_at":"2026-05-12T23:01:13.741361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen3c: 3d-informed world-consistent video generation with precise camera control","venue":null,"work_id":"9eed6fd0-4807-434b-aac7-43ce79d9aa52","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a9b42c3ea3722345b3791aa60cadc397c72662d58fc976335e85b2fde0f52d4c","observation_id":"654844e1-d016-48e3-a839-c110ecb5fcc1","resolution":{"observed_at":"2026-05-12T23:01:14.094409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen 3","venue":null,"work_id":"c13ebf76-e279-45e7-819d-83155772af0f","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2c98efd383afed8877bb2f815dbfa1daeec008219260a66840d9f104e33fc6f6","observation_id":"26ee39e3-336d-4d1e-b6ec-aeba3a8aa358","resolution":{"observed_at":"2026-05-12T23:01:14.104453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/0146-664x(82)90101-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"very scattered","venue":"Computer Graphics and Image Processing","work_id":"b9c85904-9a0c-457d-a48d-6d0f4b44144e","year":1982},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:dfb131b4ac8f79ed5d0bd2447a06bf7198e113549d9e39f414d7620b28763045","observation_id":"769806dc-f5fe-4f9d-be52-832c99f440da","resolution":{"observed_at":"2026-05-12T23:01:13.602107Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:fe349d1f24ef376eeeac716493ad60a4381b688fe2e4744d6351752756906732","observation_id":"1a43ad0e-d7a0-4a16-ba2f-6fa68d3d1a41","resolution":{"observed_at":"2026-05-12T23:01:13.746628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11280","last_updated":"2023-01-26T18:14:32Z","snapshot_observed_at":"2026-08-14T09:37:36.773540Z","submitted_at":"2023-01-26T18:14:32Z","title":"Text-To-4D Dynamic Scene Generation","version":1},"cited_work":{"arxiv_id":"2301.11280","doi":"10.48550/arxiv.2301.11280","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.11280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-4d dy- namic scene generation","venue":"arXiv (Cornell University)","work_id":"3ce955f0-5e21-404f-92ee-75f84ed8f33d","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2301.11280","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8be1706a19eb31ac459af6e9a7a3e2fba55b9ad2ad78284fb9fba08506fb85de","observation_id":"43e802b8-64de-4ea1-b362-8ab0529edb7b","resolution":{"observed_at":"2026-05-12T23:01:13.753011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Light field networks: Neural scene representations with single-evaluation rendering.NeurIPS","venue":null,"work_id":"8bba14f9-ade9-4002-bb73-cb447f373857","year":2021},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:829305165331b608b02a08fa879348ba8ad14c3fd1d857d9bb4e3abf5df03b2e","observation_id":"fc0617d6-52bd-4021-8f69-a2ccb5acd549","resolution":{"observed_at":"2026-05-12T23:01:14.187667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"aae488e1-4b8d-4e33-98e7-b721da073a2a","year":2021},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0fe0558205e7fcb888a8e44d5bc06bb2666f2b2ce48947f78207a8b771fdf3ec","observation_id":"6ea03bf2-a2d8-492f-b240-f06edf88a77c","resolution":{"observed_at":"2026-05-12T23:01:14.201259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17274","last_updated":"2023-11-03T17:49:03Z","snapshot_observed_at":"2026-08-13T05:40:01.293862Z","submitted_at":"2023-10-26T09:50:40Z","title":"cuRobo: Parallelized Collision-Free Minimum-Jerk Robot Motion Generation","version":2},"cited_work":{"arxiv_id":"2310.17274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17274","snapshot_observed_at":"2026-07-08T22:15:39.350913Z","title":"curobo: Parallelized collision-free minimum-jerk robot motion generation","venue":"cs.RO","work_id":"0b2a749e-5231-4ee8-949b-3d494b57d7c2","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2310.17274","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:e5ccb73697d1cac9076eefbe935a2a188f60ac6b31c2109fafaf7ddf88ac442d","observation_id":"488ccc1b-86f2-49fb-82ce-e6bfcb82f4a9","resolution":{"observed_at":"2026-05-12T23:01:13.759032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1x technologies | safe humanoids for the home","venue":null,"work_id":"e28289b6-cbec-4523-b498-a9ebd9761cad","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:9ce4e08e7d03c867701942cf7bfbe18b94bdef7d439c7df487123888c9f98c86","observation_id":"8833b5d3-c4f8-445d-920f-8debd9cf26b0","resolution":{"observed_at":"2026-05-12T23:01:14.223399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"e9b2a63e-ecce-4c4d-853f-9aabb179c68b","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1ce456ef5ef56b259778dce193fe1c0ffe10c5b8f712b82e91ff86e91d463705","observation_id":"2f7c672a-6f2c-446d-a1bd-d7f359c57fe8","resolution":{"observed_at":"2026-05-12T23:01:14.228413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"6c8b8805-9da0-4281-8b81-cde89bf31743","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:74f02d55866915b9388a21fc24115fd075f689cdd4c61fbf679e223a43e5a9eb","observation_id":"944ad03f-8f43-4bcd-b564-08fefcf4f9cb","resolution":{"observed_at":"2026-05-12T23:01:14.233658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:deb6a4ccf5a532c23d80bcc910c8a783c6bcd13aa04e2f04c816e15cf5bd9ff4","observation_id":"49be7c1a-e43e-48fb-b04d-dd4d4cf4ebe1","resolution":{"observed_at":"2026-05-12T23:01:13.617255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive study of decoder-only llms for text-to-image generation","venue":null,"work_id":"9b4e3959-c264-4723-9b5c-a67b62967596","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:9ca3e213f3dfd28e964ca0631d76852c0d634ac8f70cd7f7880ee8ee8b9c0d91","observation_id":"99eae887-fd5f-4c07-9951-138dbeff236e","resolution":{"observed_at":"2026-05-12T23:01:14.274833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:56:16.359259Z","title":"Frame in-n-out: Unbounded con- trollable image-to-video generation","venue":null,"work_id":"17422dc7-5bc1-4f22-9a42-63d2304c6a8d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ab76b612478193590ff394b745f8761861ff2bf21e59af5ce749e9efa9c795e4","observation_id":"44c15761-9b25-49a0-aa9c-1407d55be937","resolution":{"observed_at":"2026-05-12T23:01:13.770365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":"6246519e-2949-45ae-b4f6-122b360c635d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ed3997dae222d2c442d79e94e1623d8391794dbe2a7921124667f6ecfaee1a3c","observation_id":"fb2dc8e2-b8b4-43a5-a17b-f3ce4ba162fb","resolution":{"observed_at":"2026-05-12T23:01:14.296587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"c54687a4-d22a-401a-a2d3-1eca5df5786c","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7e2bd718e32c1848da64ed9a9ca0d3ea201cc31aefe15d10d5fdd5d9b19adf61","observation_id":"866afd17-3d65-4d32-95ae-5ddf1427481f","resolution":{"observed_at":"2026-05-12T23:01:14.315657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-08-15T19:40:13.098972Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2407.07860","doi":"10.48550/arxiv.2407.07860","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Controlling space and time with diffusion models","venue":"arXiv (Cornell University)","work_id":"5594369d-3650-4ab0-96ff-1e83983b2dfc","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:23e37e80b708e1fa62984cccfcded621e4f97ec0f17162dc44daefeaa39bc094","observation_id":"f53d5fe8-576d-4941-9640-12dca55e4056","resolution":{"observed_at":"2026-05-12T23:01:13.776381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"16a3c92f-cf24-4270-882a-9dfa125585f7","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:95604198d9d3c63c15c7456ece36ac1af3b61f43552045f46cd961c9de7b6252","observation_id":"ed7ba837-e571-4f04-b041-a9f4e77c7902","resolution":{"observed_at":"2026-05-12T23:01:14.125708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"e1e01ace-5b41-4a75-854e-0ca579e20b03","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b7c4f14ed403c60c5128ed321d2d2a2286a710b2f66636328f606ec476e6e8f3","observation_id":"3bdeaf82-ebd2-456b-8442-0534bb253c71","resolution":{"observed_at":"2026-05-12T23:01:14.169733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-08-15T09:21:12.808847Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2412.13877","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-07-08T02:04:26.240460Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","venue":"cs.RO","work_id":"86320616-05fa-4c08-8bc0-4377e53bdba5","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1ad21351557accdaa8eeac4696a3ce18bf005285a331f9d5e2508c739a5717c8","observation_id":"68418d26-aa82-45e3-a780-4df51bc9b894","resolution":{"observed_at":"2026-05-15T22:14:18.432154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ties-merging: Resolving interference when merging models.NeurIPS","venue":null,"work_id":"8acf3664-c851-4ba9-b5e1-8aff8ba488af","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a4bd154d0c75f8c61448444125614159924cd7510b8a13152d620df925c3d1b7","observation_id":"1c2f1d5a-30c3-4efa-972e-32f679470874","resolution":{"observed_at":"2026-05-12T23:01:14.240424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":"2408.07666","doi":"10.48550/arxiv.2408.07666","metadata_source":"pith","pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","venue":"cs.LG","work_id":"add1bfdb-f9a2-4280-a81e-ae663e81b3e3","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:fa883aa023a34e0f10fa3f305dcbacadc7a15ac0cf842dbc0b34f535dc7b6397","observation_id":"51988b6b-b002-4279-ba30-465ed87158a8","resolution":{"observed_at":"2026-05-17T22:16:05.189340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-08-15T10:11:58.661690Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:81c5e04fd6dcf651f2064e152243f97625df011cae92d4cb114b23e8c6913444","observation_id":"0c3c7d1d-2359-447e-acd6-b3946edd022e","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:43f3f8a3a868dace81d1693c9f1903913793e79a47cff89984cfb736ed5721f8","observation_id":"74b42442-84f4-46f9-b307-b658f57c8fe1","resolution":{"observed_at":"2026-05-12T23:01:13.799820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:11.415417Z","title":"Data-regularized reinforcement learning for diffusion models at scale","venue":null,"work_id":"ce25045f-5459-416e-916e-0059f467f8fe","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:6eba2f6f2a11c4241af9d7216e42133d0e0e6c258e2a9d5fb34df27b66fae738","observation_id":"f5188f6a-8cf5-40e6-b1b3-820765e7236c","resolution":{"observed_at":"2026-05-12T23:01:13.811776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"ccbb2008-431d-496e-92e5-9c3d04d61385","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0cd6a3f1a6661c7aadb8829c32408b9858f9c43183edb2360f2fded11551b8c1","observation_id":"252b42ad-53b3-4bc5-a695-a07a8dea90ff","resolution":{"observed_at":"2026-05-12T23:01:14.085751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4e299b9409b1592989fabaa8687b84ede30d75a3e1e5c5a827b3104acc75d068","observation_id":"8af2157c-8527-42e4-97d2-2543d4aba109","resolution":{"observed_at":"2026-05-12T23:01:13.822345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-13T06:51:53.063809Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b228e1c563c999de8d747b4741a3546d2ba54b46cf9318fbefca5ed52197dc84","observation_id":"2ec731de-1750-4793-9558-1281b08fe6fe","resolution":{"observed_at":"2026-05-12T23:01:13.834624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02319","last_updated":"2024-11-05T06:08:43Z","snapshot_observed_at":"2026-08-14T09:37:03.445575Z","submitted_at":"2024-11-04T17:45:44Z","title":"GenXD: Generating Any 3D and 4D Scenes","version":2},"cited_work":{"arxiv_id":"2411.02319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02319","snapshot_observed_at":"2026-07-07T14:33:54.303149Z","title":"Genxd: Generating any 3d and 4d scenes","venue":"cs.CV","work_id":"e8253c41-3568-4ea6-bfb9-0d8e589c07ce","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2411.02319","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8ff7a7b7004293ca6894b59de24f2d4ed53aa6b41d1d7c55aeb063908a23ae2c","observation_id":"e6b72cb2-cb9b-4d0f-ae62-3342d8ab69a7","resolution":{"observed_at":"2026-05-12T23:01:13.848208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02316","last_updated":"2025-07-03T05:01:46Z","snapshot_observed_at":"2026-08-13T16:02:59.038745Z","submitted_at":"2025-07-03T05:01:46Z","title":"Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos","version":1},"cited_work":{"arxiv_id":"2507.02316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02316","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are synthetic videos useful? a benchmark for retrieval-centric evaluation of synthetic videos.arXiv preprint arXiv:2507.02316","venue":null,"work_id":"d44f676e-2f71-4922-907f-b985d2695793","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2507.02316","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:12cfef3cfaca156f0b1c599cf78054c6dc3dceff2415f40dda7630f3ece8886d","observation_id":"49ce5cb8-f139-4fb8-9c88-1d606b8f9a2b","resolution":{"observed_at":"2026-05-12T23:01:13.858638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-08-13T13:52:10.663166Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"cited_work":{"arxiv_id":"2510.08431","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08431","snapshot_observed_at":"2026-07-11T01:07:44.823334Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","venue":"cs.CV","work_id":"c4d59581-ef40-441f-937a-e325bff802be","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2510.08431","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2a7bd356a91c38f0677b794215f9857f4c112933676228007842359f2134f1f1","observation_id":"333d6195-f51a-44ff-bbea-23e061f4f542","resolution":{"observed_at":"2026-05-12T23:01:13.868632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01989","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.226892Z","title":"Unipc: A unified predictor-corrector framework for fast sampling of diffusion models.Advances in Neural Information Processing Systems, 36:49842–49869","venue":null,"work_id":"13626a02-1712-4ec2-968b-44548bb50736","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f2ce00f553befb9f6a4428e911364bbb6d25c5f929bd72c558d2cc1b38dcf3b2","observation_id":"ba33fbdf-c62f-4392-a184-c2149205d762","resolution":{"observed_at":"2026-05-12T23:01:13.875615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":"2508.02095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models","venue":null,"work_id":"fd121458-5940-4f1f-8f85-380ea73e3a51","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a86a76f4dea3e39320116eb712cfa8923128b0900020380c59b3a4179cd4a428","observation_id":"b9d7bddd-8785-4d5c-bb5e-1031eda8cec5","resolution":{"observed_at":"2026-05-12T23:01:13.883037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":1,"verified_exact":62,"verified_fuzzy":34},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 100 inbound Pith citation observations for arXiv:2511.00062."}