{"as_of":"2026-08-09T23:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:057f843dc80effbe56d759d49af57da87317e0efe17937ecad90e82d988c468c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:31.307028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T07:26:54.481828Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T14:31:31.307028Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked to- kens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18650","last_updated":"2025-05-24T11:35:09Z","snapshot_observed_at":"2026-08-07T14:25:57.955968Z","submitted_at":"2025-05-24T11:35:09Z","title":"ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.307028Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.18650"},"observation_digest":"sha256:4e90a0217caa29719d7f63d07c7827afc3ba8d2fab67f72c7c0d754f69aba657","observation_id":"a403d5d3-3523-41dc-97ee-a0e3898b796d","resolution":{"observed_at":"2026-08-07T14:31:31.307028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T14:03:20.562826Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked to- kens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-07T13:55:36.207486Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.562826Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:10542466ac23dd57b20788656ca7965f8e8e31f3631b10540a9b4947a62f0591","observation_id":"909be15d-779c-4c8f-9a89-a3e915be256c","resolution":{"observed_at":"2026-08-07T14:03:20.562826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T13:13:46.886225Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22421","last_updated":"2025-05-29T12:41:53Z","snapshot_observed_at":"2026-08-09T00:50:02.229626Z","submitted_at":"2025-05-28T14:46:51Z","title":"GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:46.886225Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.22421"},"observation_digest":"sha256:fb5bf1f92d3d57f7009169024358cb58b4360e80e4126560ee48186251823213","observation_id":"070a908b-344a-46e1-9682-121b51bcfe98","resolution":{"observed_at":"2026-08-07T13:13:46.886225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T13:01:00.850247Z","title":"Worlddreamer: Towards general world models for video genera- tion via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-08T15:15:33.938758Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:01:00.850247Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:f33103ea27c9a12320af1d1e5739e8df5ad1a9de62c15d75ea243abfa69fa6a6","observation_id":"5527bad4-bd6c-4d2a-a004-2ab86e607bdb","resolution":{"observed_at":"2026-08-07T13:01:00.850247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T12:08:36.336903Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00417","last_updated":"2025-05-31T06:43:00Z","snapshot_observed_at":"2026-08-07T12:03:35.109497Z","submitted_at":"2025-05-31T06:43:00Z","title":"World Models for Cognitive Agents: Transforming Edge Intelligence in Future Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:36.336903Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2506.00417"},"observation_digest":"sha256:aefc5c9cd713ad29bf0bc66c2bec23ff2030401a4e8e10b71b16d03cf0837320","observation_id":"c2ba2f92-7369-45f0-b211-78787180e80e","resolution":{"observed_at":"2026-08-07T12:08:36.336903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-06T23:35:04.283988Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked to- kens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17201","last_updated":"2025-06-20T17:50:37Z","snapshot_observed_at":"2026-08-06T23:28:21.347321Z","submitted_at":"2025-06-20T17:50:37Z","title":"Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:04.283988Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2506.17201"},"observation_digest":"sha256:3c6fc5e17389072fee1947cc90dbb5c4ccc5bf6f29103a81296fa32223b06ef5","observation_id":"02144c37-fea5-499c-b8e0-7e0622570869","resolution":{"observed_at":"2026-08-06T23:35:04.283988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-06T19:35:42.847397Z","title":"World- dreamer: Towards general world models for video generation via predicting masked tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05198","last_updated":"2025-07-07T16:58:17Z","snapshot_observed_at":"2026-08-07T04:00:02.770729Z","submitted_at":"2025-07-07T16:58:17Z","title":"EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:35:42.847397Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2507.05198"},"observation_digest":"sha256:e0d286108842918ef58e37181b074d4918a09f332f5b47534cd2367bb7c1c7aa","observation_id":"d07a90e7-d50c-4e12-aa4a-6cac09631bd7","resolution":{"observed_at":"2026-08-06T19:35:42.847397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-06T16:45:06.168043Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12762","last_updated":"2025-07-17T03:34:54Z","snapshot_observed_at":"2026-08-07T19:43:50.186794Z","submitted_at":"2025-07-17T03:34:54Z","title":"World Model-Based End-to-End Scene Generation for Accident Anticipation in Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:06.168043Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2507.12762"},"observation_digest":"sha256:8092bf2a4bf49a8baadc9e25e966f656a7491db3d18393a1ddf74ceeab67c921","observation_id":"5a0906ad-ae6e-45c4-98de-e213bc1142c3","resolution":{"observed_at":"2026-08-06T16:45:06.168043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-06T15:27:02.986657Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15824","last_updated":"2025-07-21T17:30:46Z","snapshot_observed_at":"2026-08-07T10:31:41.147971Z","submitted_at":"2025-07-21T17:30:46Z","title":"Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:27:02.986657Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2507.15824"},"observation_digest":"sha256:bc173fe6dd577367f4446c73e2d35407cb5726de3e189df7507456e0089e4bf3","observation_id":"fe0eb035-5071-4400-b47a-e6a17f6bbff8","resolution":{"observed_at":"2026-08-06T15:27:02.986657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-05T22:58:41.359450Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06096","last_updated":"2025-08-08T07:42:14Z","snapshot_observed_at":"2026-08-09T16:41:54.396993Z","submitted_at":"2025-08-08T07:42:14Z","title":"Bounding Distributional Shifts in World Modeling through Novelty Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:41.359450Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2508.06096"},"observation_digest":"sha256:001df7580a730d864e29ee4a84f147d32650546ffb17c13979e96cbadcb6b3af","observation_id":"4811cc60-00c2-4d3a-855c-db6f784593b1","resolution":{"observed_at":"2026-08-05T22:58:41.359450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-05T15:29:25.564545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-07T08:18:37.593830Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.564545Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:434ce8962e26f3eeb930b7bb984af2b0b6c7c55337393ec329023982ceab7089","observation_id":"2cb8cdbc-7c98-453f-8dc6-0ae7e0e337cc","resolution":{"observed_at":"2026-08-05T15:29:25.564545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-04T09:12:34.159128Z","title":"World- Dreamer: Towards general world models for video generation via predicting masked tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-07T10:54:05.573771Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:34.159128Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:9042ff989991b732e9683f5f61df14e2b406922e77bca3fac634106e4134c93a","observation_id":"2379bea7-79bb-4acc-860c-822a9dae3eeb","resolution":{"observed_at":"2026-08-04T09:12:34.159128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-03T20:59:52.965693Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:52.965693Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:39bdd1b462c4e3bdfe3d3cd41aaa95e5828cf9d9de7ee34771c15cddcf73c83a","observation_id":"26ef742e-c6f0-44ef-a0e4-6df9e6d97bf6","resolution":{"observed_at":"2026-08-03T20:59:52.965693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2604.09059","last_updated":"2026-04-10T07:38:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T07:38:05Z","title":"Learning Vision-Language-Action World Models for Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T17:08:10.442655Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2604.09059"},"observation_digest":"sha256:4e71f267934e5157d079f68738ddc17723116932f462d300e3601910a8dc442b","observation_id":"651d5fd1-9608-495e-86c4-a9fdda929ac9","resolution":{"observed_at":"2026-05-11T07:31:00.630911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:729143fd4f11219e63e8e45286b3f97f9476161e52dbb4431fa41193ca788a04","observation_id":"fb69bb43-94cd-4a36-832a-1e1c72498613","resolution":{"observed_at":"2026-05-10T10:09:08.137060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2605.01950","last_updated":"2026-05-03T16:19:45Z","snapshot_observed_at":"2026-07-06T23:15:07.159340Z","submitted_at":"2026-05-03T16:19:45Z","title":"TRAP: Tail-aware Ranking Attack for World-Model Planning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:45.407680Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2605.01950"},"observation_digest":"sha256:05d67348880b5c3d34001d431cf01499a6b99fe628aba64030dc0c7a50b5e684","observation_id":"1b1da9b8-f329-4cee-aceb-c00d0689b945","resolution":{"observed_at":"2026-05-11T10:56:04.888141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:46bf47626cce69f757171831935ced1d5a575526d2a84e7a788f774c5ad7f2a1","observation_id":"e971dfd0-1021-4e5d-9cf2-b9d926340efe","resolution":{"observed_at":"2026-05-13T04:57:17.900778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2605.16713","last_updated":"2026-06-11T14:17:29Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:52:11Z","title":"GeoWorld-VLM: Geometry from World Models for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T17:57:00.909897Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2605.16713"},"observation_digest":"sha256:965c929bf1ff149903438b6166735b505911b2d623924f103e787da7ba8dbbe0","observation_id":"053eab7f-6169-4bd4-8288-7e3dfe9b8472","resolution":{"observed_at":"2026-05-20T17:58:49.588513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2605.16713","last_updated":"2026-06-11T14:17:29Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:52:11Z","title":"GeoWorld-VLM: Geometry from World Models for Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T19:02:05.125937Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2605.16713"},"observation_digest":"sha256:e96aae9deff5d4291b8bb75a5709b6e6026c57a63d80ffd3ac39f25499ea57b4","observation_id":"154bcbdb-bb8a-4954-bc18-176528501ffe","resolution":{"observed_at":"2026-06-30T19:05:00.616391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2606.04737","last_updated":"2026-06-03T11:20:00Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T11:20:00Z","title":"Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T07:02:37.291472Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2606.04737"},"observation_digest":"sha256:c7b6a1641d90b699c2a8de8955760b1e6fb55853cc80a96e17bc2dd4445c7af5","observation_id":"fcc281d8-3e7e-4465-8d2d-8d5739501636","resolution":{"observed_at":"2026-07-02T07:16:44.709304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-12T08:04:48.963890Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02642","last_updated":"2026-07-02T17:02:43Z","snapshot_observed_at":"2026-08-03T12:39:47.539491Z","submitted_at":"2026-07-02T17:02:43Z","title":"GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-07-12T08:04:48.963890Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.02642"},"observation_digest":"sha256:246a0891caedc9672083a74098746a91491a77da74f2a726e14e4c7ccb7a4ae1","observation_id":"6ecb5a2e-52ad-48f6-8d59-35cac1e89ea9","resolution":{"observed_at":"2026-07-12T08:04:48.963890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-11T15:37:01.397370Z","title":"arXiv:2401.09985 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04661","last_updated":"2026-07-06T04:31:45Z","snapshot_observed_at":"2026-08-07T23:45:46.003514Z","submitted_at":"2026-07-06T04:31:45Z","title":"Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T15:37:01.397370Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.04661"},"observation_digest":"sha256:7efdfe654579312085bfb307aeaf173a9e26fb4f028916b4a6829f9896371152","observation_id":"a0789bfe-3947-42dd-82ac-bd6ef23cb264","resolution":{"observed_at":"2026-07-11T15:37:01.397370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":"2401.09985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-10T07:26:54.481828Z","title":"WorldDreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985","venue":"cs.CV","work_id":"9f18e581-221b-41ef-95a4-5de4c12a8c5f","year":2024},"citing_paper":{"arxiv_id":"2607.08448","last_updated":"2026-07-15T16:40:12Z","snapshot_observed_at":"2026-08-04T18:37:38.875340Z","submitted_at":"2026-07-09T13:08:54Z","title":"Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T07:18:57.823444Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.08448"},"observation_digest":"sha256:0e2ca13ecae5675e164b845e7b090d5e9a82cb79741a187ac2208c0081fcd9d3","observation_id":"92a24d95-39fc-4534-b703-ebd4576db2bf","resolution":{"observed_at":"2026-07-10T07:26:54.483224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-02T07:56:56.491230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08448","last_updated":"2026-07-15T16:40:12Z","snapshot_observed_at":"2026-08-04T18:37:38.875340Z","submitted_at":"2026-07-09T13:08:54Z","title":"Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T07:56:56.491230Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.08448"},"observation_digest":"sha256:4a8fb1df02ac731faca5de291e052e6cf7ecb1b18df391fcb6a38281f68ca0be","observation_id":"597caa6f-e5d4-4498-8e63-5e4e3ee1775b","resolution":{"observed_at":"2026-08-02T07:56:56.491230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-02T03:16:53.075596Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13960","last_updated":"2026-07-17T13:39:37Z","snapshot_observed_at":"2026-08-03T18:30:12.569959Z","submitted_at":"2026-07-15T15:46:42Z","title":"GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.075596Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.13960"},"observation_digest":"sha256:7d51170a1271256041a9b9f7230f73526e2d09d8908cccfce53e0a76b49a758f","observation_id":"0f539b69-ceb2-4482-bd59-174de125e61f","resolution":{"observed_at":"2026-08-02T03:16:53.075596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-02T00:04:08.689523Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-08T14:49:11.837999Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.689523Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:d6600d2cd6b8dc72efdd2689560556938ce2492fd188d58d2824d57e057ccb46","observation_id":"5bbb7262-ef3d-492a-be20-e2d399360cd3","resolution":{"observed_at":"2026-08-02T00:04:08.689523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-01T14:44:20.192036Z","title":"arXiv preprint arXiv:2401.09985 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18664","last_updated":"2026-07-21T03:23:52Z","snapshot_observed_at":"2026-08-01T23:55:18.410542Z","submitted_at":"2026-07-21T03:23:52Z","title":"DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:44:20.192036Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.18664"},"observation_digest":"sha256:c5bce0f3ab1eb41dabe7eb5fed5cdb6683621b0fbba9ad69e686bb2e3f3f5e04","observation_id":"a8405e07-acc2-4b16-bcb5-82b027e61bed","resolution":{"observed_at":"2026-08-01T14:44:20.192036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-31T23:29:12.915500Z","title":"arXiv preprint arXiv:2401.09985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:12.915500Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:40c13245bb772e8031daa8ee243cbba9258078f0af8a1caedd8c5fd301d91752","observation_id":"08b1164e-9f3f-4ef8-a680-bade7b797e1f","resolution":{"observed_at":"2026-07-31T23:29:12.915500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-07-30T21:05:52.754117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26789","last_updated":"2026-07-29T11:31:33Z","snapshot_observed_at":"2026-08-08T10:24:44.011995Z","submitted_at":"2026-07-29T11:31:33Z","title":"CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-30T21:05:52.754117Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.26789"},"observation_digest":"sha256:04ac953e081d453887326195487bc190959bb6b30bab55c2ca8904c7eeedf0a4","observation_id":"cda22c50-5f3f-4e2e-91de-a2363be01409","resolution":{"observed_at":"2026-07-30T21:05:52.754117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.09985/citation-record","integrity":"/paper/2401.09985/integrity","json":"/paper/2401.09985/citation-record.json","paper":"/paper/2401.09985"},"outbound":[],"paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2401.09985."}