{"as_of":"2026-08-19T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:757825f4d7c543ce96fca09bfd6bfc5930d5ea44b56757789077da8f17b49b62","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:07:24.277177Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06006/citation-record","integrity":"/paper/2506.06006/integrity","json":"/paper/2506.06006/citation-record.json","paper":"/paper/2506.06006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.195888Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"e5a40d38-1825-4240-8ca5-1875e9071f3b","year":2018},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:23.988932Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:42c34571126c39332e5fd6b6c46c7a33d428225b13c139ef3a542708626ddd86","observation_id":"8863294b-c256-4205-9463-1d4538c03e41","resolution":{"observed_at":"2026-08-07T06:07:25.201072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T06:07:23.995257Z","title":"Cosmos world foundation model platform for physical AI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:23.995257Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e3f8e89024942895ef0827e85b7b7ef8c56a3eea01e060b91144c9d06308a38a","observation_id":"4286e6d7-37ae-4216-b2cc-2fbec26dba99","resolution":{"observed_at":"2026-08-07T06:07:23.995257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.001012Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.001012Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:52e7650a64e923ecda8986eeb39b6f4dd9cd1ad8b09dc1c55a0247ff9f7297fa","observation_id":"0ca95a54-c6cc-4406-a062-1c01f424057b","resolution":{"observed_at":"2026-08-07T06:07:24.001012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.166669Z","title":"Video generation models as world simulators","venue":null,"work_id":"aceafd82-4e7d-4b9f-b7c8-3e9d4671c5f4","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.006263Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:1dfefb28767c58f050dc286379cb4632c7d0781d2c1b80852c067c7082eb8aa4","observation_id":"7d0c545d-536c-4143-ba7b-cbf786b12461","resolution":{"observed_at":"2026-08-07T06:07:25.173532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-16T13:06:31.854495Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-07T06:07:24.010922Z","title":"WorldSimBench : Towards video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.010922Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:b0319377b268b92819f09155a2f74f5c0a1e96fdf5e31856d7fa484333ad19ac","observation_id":"ea51fd94-ebf7-46bc-bed2-42afdc6a2250","resolution":{"observed_at":"2026-08-07T06:07:24.010922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.151089Z","title":"Do as I can, not as I say: Grounding language in robotic affordances","venue":null,"work_id":"c323b2ae-8cb6-4c58-b084-d11410679471","year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.015924Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:7eae9f59a921bf5ff96d8a6d0ab8da0673a9c83d87bad3acd1f9baba8aa0fa73","observation_id":"7c89477f-64fd-4e9c-acd9-ef939b47b253","resolution":{"observed_at":"2026-08-07T06:07:25.155966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.133172Z","title":"Inner Monologue : Embodied reasoning through planning with language models","venue":null,"work_id":"eb862327-80f6-4920-a83c-c4d4515d4318","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.020456Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e21ceac8606fea486a22185a0df515828e2f11d130d30710d5f1adb34e04533b","observation_id":"27e59029-a26d-4f79-bcae-5794c0d4232c","resolution":{"observed_at":"2026-08-07T06:07:25.137732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-17T08:25:34.071490Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-07T06:07:24.025967Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.025967Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e30e252b842fe62452cc205a261e800ea2a6e25d6d4acceea099d3f2cda0c276","observation_id":"3092e8bf-2fe7-43ca-b59b-c0bbd45e614e","resolution":{"observed_at":"2026-08-07T06:07:24.025967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-14T09:46:32.787845Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-07T06:07:24.031045Z","title":"A generalist agent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.031045Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:40917edc213ce36167e0f7aff1da4bce1608fd50e3493e5069e55fce6600e6d3","observation_id":"2a29bc56-079a-476f-adc6-e35ffee01026","resolution":{"observed_at":"2026-08-07T06:07:24.031045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T06:07:24.035996Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.035996Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e9077df7395900fe2ac501542e05e62fbd21581ea19ed819ebf1fac3d1f7ea2f","observation_id":"32537f05-b388-4691-98de-c7c20ef1cf32","resolution":{"observed_at":"2026-08-07T06:07:24.035996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.118265Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":"ccafd235-5422-416f-bdd9-382b5f6dde81","year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.042286Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:9f1db41a79518f25d60741492ad41338fa0ac95aa1ae9f2ed91da0a6e2e3a9e0","observation_id":"78cea173-cdcd-4395-8461-ecbc2d080cdc","resolution":{"observed_at":"2026-08-07T06:07:25.122718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T06:07:24.046755Z","title":"World model on million-length video and language with blockwise RingAttention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.046755Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:f4430449433feda62792885e1925803cbe8de601949ebbbc09ebc51670a80cd5","observation_id":"d0ab5390-6057-4e67-ae4b-ba144b5846da","resolution":{"observed_at":"2026-08-07T06:07:24.046755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-14T09:57:44.505326Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-07T06:07:24.051408Z","title":"Do generative video models learn physical principles from watching videos? arXiv preprint arXiv:2501.09038 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.051408Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e8140fb592d6d428691c30390483a1cf81acf33860506415edab382c15e3804b","observation_id":"d3c9dccb-f84f-44ff-a2fa-27e1dc9191db","resolution":{"observed_at":"2026-08-07T06:07:24.051408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.103118Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":"5ab0c545-8e1b-4288-8f15-47adb8afe6d2","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.056924Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:c35f7063e187838af950a7708b8267fe4b2a2ad29cc431272b4ab5ed11b14e21","observation_id":"6cf3a3ba-b5db-450e-806f-021a7abf32c7","resolution":{"observed_at":"2026-08-07T06:07:25.107730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.087084Z","title":null,"venue":null,"work_id":"59252609-b577-4443-817f-6a23b04376a9","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.061561Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:0c591a30501f23cf8138364d84c8dcb499e7b2d9cfc26f6c1408ae4c67b8eb32","observation_id":"69c4f1b3-c04f-4d8c-9e03-c6280b7f88ff","resolution":{"observed_at":"2026-08-07T06:07:25.091676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.071313Z","title":"Can language models encode perceptual structure without grounding? A case study in color","venue":null,"work_id":"921394ed-6004-448c-abc0-383a85e04ec8","year":2021},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.066153Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:97c3f4227c5a68c58cb5e9992a2ba0a840a544818e42ea00221212ade1f42d62","observation_id":"85becdf0-b936-4438-b842-bbc53d393128","resolution":{"observed_at":"2026-08-07T06:07:25.075935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T06:07:24.072246Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.072246Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:c886e7da02b76e1f65bfb44656b5a51ed370c9a32e18ade163864d1dfb060ca1","observation_id":"3a0aab83-bf9d-49ef-9bf7-5f8aecfbd6df","resolution":{"observed_at":"2026-08-07T06:07:24.072246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.054719Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","venue":null,"work_id":"c8f6898e-9907-46de-9bfc-4512bda9fb72","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.078717Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:f40e17a194ace2a5a08c9545b164f9cf27039d9a2f1ce994e0c33fb2a1c73ff1","observation_id":"0f58401b-5e6a-42a0-aa18-07a5686137cb","resolution":{"observed_at":"2026-08-07T06:07:25.060218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.038247Z","title":"Video PreTraining (VPT) : Learning to act by watching unlabeled online videos","venue":null,"work_id":"1239b43f-6813-4b19-a7d9-726525cfcda2","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.084572Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e284325406f3a46b96b2699ffe04c556e033f74698552fefac3fe9b4a54df39b","observation_id":"01bca877-3c16-4f23-92ba-7269b995fbf4","resolution":{"observed_at":"2026-08-07T06:07:25.043321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.020639Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"3b5b2e6d-38ec-4986-bab3-08c4315c0b39","year":2019},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.094006Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:94b3ac632d737641af4314bfad3111c698520b707e9ee66f09beebd664c0df06","observation_id":"59a6acba-88a1-4f93-8150-cd732c3975b0","resolution":{"observed_at":"2026-08-07T06:07:25.027199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T06:07:24.106289Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.106289Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e87ec7a07789cde377e0ab719b653f56245543e3e89fa3d6deaa40c5ba876284","observation_id":"6f02e7ac-5174-4f45-ab1a-a94afb616404","resolution":{"observed_at":"2026-08-07T06:07:24.106289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-07T06:07:24.112945Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.112945Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:ea3b5d859171474ea10f29f4a876865ada5e930f4b2431e5485feafacae639bd","observation_id":"e580f276-799e-4ede-9b90-7b96d4523b84","resolution":{"observed_at":"2026-08-07T06:07:24.112945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T06:07:24.117780Z","title":"UCF101 : A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.117780Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:e6bbc33d644ae9afa88a223927da0685059ce459287ec35a7a11834f5800a0c1","observation_id":"addd9681-e6dd-4c3d-9596-6b0341cff92a","resolution":{"observed_at":"2026-08-07T06:07:24.117780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T06:07:24.123574Z","title":"VILA-U : a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.123574Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:926e860ee4884ac9efce56b18a99f22675583bc04fd7f582b9a27367526a780b","observation_id":"845beb56-b69f-4cf9-b273-296b9a23170e","resolution":{"observed_at":"2026-08-07T06:07:24.123574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:25.004475Z","title":"Scaling egocentric vision: The EPIC-KITCHENS dataset","venue":null,"work_id":"3982e75e-697a-44b9-9345-3260a3338de9","year":2018},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.131233Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:210bdec2d46c507d34a4af0e8dd4ad216d52ac9dd8a8020aa2f95d19ba84790c","observation_id":"b7a16e98-9bca-4d02-9e3f-2ebaeb863cd8","resolution":{"observed_at":"2026-08-07T06:07:25.009280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T06:07:24.139015Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.139015Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:7cfb8b1e67ab52100c3e7cf410d10f4e14ce7b590f76561dc853a5c247963711","observation_id":"8b21755f-24ef-46e9-81fb-a454489583d8","resolution":{"observed_at":"2026-08-07T06:07:24.139015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T06:07:24.146649Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.146649Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:cc1a2171aa9cd0bd310de42a50f6af54eac7a0346bfae796a61ae54b01499a8b","observation_id":"cee2bfe3-7a20-43d3-9550-c4581fa7b974","resolution":{"observed_at":"2026-08-07T06:07:24.146649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.988575Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":"8bef9409-f1ef-44f3-b1e4-1d5835633031","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.154506Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:82a7a2a2a20a18dc41b4b44ffc7db426b979b2efea70d03b013333911371048e","observation_id":"abc8ad40-06ad-4a4f-9ead-752ccaf4dcea","resolution":{"observed_at":"2026-08-07T06:07:24.993415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.972222Z","title":"InstructPix2Pix : Learning to follow image editing instructions","venue":null,"work_id":"d04f86aa-d8d0-4e3e-b364-0799d923da8d","year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.160136Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:8cd02641beee4a09ab07ac66635fc36d4079717d74a9b55a87f05a800b8a449f","observation_id":"d90e9194-b20e-49c3-aa98-da96adc23f23","resolution":{"observed_at":"2026-08-07T06:07:24.978148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T06:07:24.165875Z","title":"GoT : Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.165875Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:36460306094b6009566f950d7897e9dec117f8ff47585401a3bf564b8465ac56","observation_id":"e85fb9d6-0103-4439-b9cc-e33646806b97","resolution":{"observed_at":"2026-08-07T06:07:24.165875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.956489Z","title":"SmartEdit : Exploring complex instruction-based image editing with multimodal large language models","venue":null,"work_id":"3b6ef248-390e-40dc-9891-b1ee14a412d4","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.171421Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:8ca02d7ca99d84dc988511dc9be97dc542675da93de6a24c922c1f078aeb3f5a","observation_id":"e0c0d67e-b944-490e-99fc-7cb50afc0217","resolution":{"observed_at":"2026-08-07T06:07:24.961540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.938703Z","title":"BERTScore : Evaluating text generation with bert","venue":null,"work_id":"7cb66679-3afd-4a30-a4dc-67151a587a89","year":2020},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.177171Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:4c2db744842c9e66278b0e48c785ae496de5c69fe9671a099939efe9fa6ae99c","observation_id":"9f064c14-cceb-4b80-a95a-21b137f4c6f1","resolution":{"observed_at":"2026-08-07T06:07:24.943531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.921465Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":"b21f9ad9-f600-4fd2-9a7e-5e7cf31c0719","year":2004},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.181794Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:f211ecb131d29ba193664f6693b2f7f60fc8702fe72b02b13f3b9edb1c19142b","observation_id":"3a054d53-0926-4a4b-8846-47f5df5cce80","resolution":{"observed_at":"2026-08-07T06:07:24.926323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.905556Z","title":"BLEU : a method for automatic evaluation of machine translation","venue":null,"work_id":"24ade54b-8f16-4a4f-985c-af6d4acc44d5","year":2002},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.186374Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:6c1328fc94064acadc90c25c502ed933ac657c348f59b7f929a21eba4fe09aa6","observation_id":"40bd7703-77e1-4a64-8af0-24e30a93a50c","resolution":{"observed_at":"2026-08-07T06:07:24.910375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.890205Z","title":"Variational best-of-n alignment","venue":null,"work_id":"1a0631c6-336b-4e8b-beba-09d495c1fdd2","year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.192078Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:fcb50ba86838085fefa641fe523ee1d3e56d603e2f18bee914e00999bd2aae23","observation_id":"22b337b0-2348-4812-b120-9203aac9fc09","resolution":{"observed_at":"2026-08-07T06:07:24.894651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.874732Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"abb6fc25-9a24-44e9-b9ee-54b7acbb6e01","year":1988},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.196626Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:24112fb983fb0c70d270eb71da23ff255d41548eb62809d0cfd89099a80d6119","observation_id":"04175720-5e5d-4a3d-bbb1-8affe0c9027f","resolution":{"observed_at":"2026-08-07T06:07:24.879924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.859129Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":"1ddc61d7-0954-428e-ae70-49b98cd3ffcd","year":2019},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.201635Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:d28120388be0a0fe2678c37f35cd64cacd5e45de383d6c4d448099964adc29fc","observation_id":"d3207217-fac6-436e-a918-954b2067100b","resolution":{"observed_at":"2026-08-07T06:07:24.863771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.843614Z","title":"Transformers are sample-efficient world models","venue":null,"work_id":"3b2115e5-12c2-4819-b0ae-54a68594066a","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.206106Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:c1f7bdec1dc5e3a028fa1425d2831b451ee57dea87367bd1b1af29c1ca1d349d","observation_id":"e934c709-0463-4043-b79d-342cc8da7aa4","resolution":{"observed_at":"2026-08-07T06:07:24.848709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07109","last_updated":"2023-03-13T13:43:59Z","snapshot_observed_at":"2026-08-18T04:38:18.621094Z","submitted_at":"2023-03-13T13:43:59Z","title":"Transformer-based World Models Are Happy With 100k Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07109","snapshot_observed_at":"2026-08-07T06:07:24.210816Z","title":"Transformer-based world models are happy with 100k interactions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.210816Z"},"links":{"cited_paper":"/paper/2303.07109","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:fe96d421e0fbd4a1d17235ca5aaa9a7fe78cf53a910d6371a928cc00b829b562","observation_id":"f5d5c6b4-4972-4c15-90a1-8e701d569918","resolution":{"observed_at":"2026-08-07T06:07:24.210816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.827351Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":"cad47d20-e061-4ec2-b753-e63f82fe0e4f","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.215773Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:6e62930599c7007b243f80dca29fc6d6045ce2225d754af1bfcca5d2d4a83757","observation_id":"92f9b374-e22a-4e4f-8497-f805085aa920","resolution":{"observed_at":"2026-08-07T06:07:24.832798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.811316Z","title":"Video-LLaVA : Learning united visual representation by alignment before projection","venue":null,"work_id":"d18df7be-fe03-463a-985b-ea8456922add","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.220051Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:f5fa53fd722ca20a8bd19ac403d97d3f0c5f50633b7e979aa11af23d2ec12a98","observation_id":"1ec03a46-1e03-43c3-9ea4-a5a150fe8928","resolution":{"observed_at":"2026-08-07T06:07:24.816123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T06:07:24.224463Z","title":"Janus-Pro : Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.224463Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:72a1df152032bdb4a00c91eb22e48471dc6f6e24c4a56ea37778909652206649","observation_id":"0ee50795-2a17-4ce8-b0d3-d58b82240769","resolution":{"observed_at":"2026-08-07T06:07:24.224463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.793756Z","title":"iVideoGPT : Interactive VideoGPTs are scalable world models","venue":null,"work_id":"cd609746-0160-4c74-b2bc-8ef02db79c35","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.229666Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:7e8995ab33c8842e2132ebc912cd6ee6728c6b8b67e51dbfa8966353e138fc1b","observation_id":"705237c3-ef8a-4da8-ab19-11f7323d799e","resolution":{"observed_at":"2026-08-07T06:07:24.799182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.775801Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"c1a46495-af05-4f4b-a882-04716a6ebe20","year":2021},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.234370Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:5e971b6835a7da17188f29c910054eb79b4c02081c5ae19b92c2bdeb5c3bf7cf","observation_id":"3d3f5554-3e1e-4183-b63f-9c8d3a053a5e","resolution":{"observed_at":"2026-08-07T06:07:24.780990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.759319Z","title":"Vision-language models provide promptable representations for reinforcement learning","venue":null,"work_id":"d66918a0-6ad3-41fe-963d-66f3c5f4be03","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.238717Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:39c8f342e15154b04aa2d3bf12a3ee1041468c0970412ff4c3776ae6beb66af4","observation_id":"0d753bfb-16d2-407e-bd88-cf44f27b7454","resolution":{"observed_at":"2026-08-07T06:07:24.764728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.743170Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":null,"work_id":"7b3b7e81-8e9f-4085-a1e3-5de00945fb86","year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.244183Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:cf098d79955e27337377b2357713acd7c0c8f6e90bf4c223c2513d363b56e802","observation_id":"d8e610c3-5eba-4198-89e6-b50ebdb6ae98","resolution":{"observed_at":"2026-08-07T06:07:24.748169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-16T14:15:04.911971Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-08-07T06:07:24.250329Z","title":"Video as the new language for real-world decision making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.250329Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:26e6e5b80243d8d4e44206ba3c75e8550dd8942e9a3dd4b2cb29963733ae71c4","observation_id":"bd6a97b2-880f-4f4a-81a5-1f4dba080336","resolution":{"observed_at":"2026-08-07T06:07:24.250329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-18T15:03:20.669874Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-07T06:07:24.256971Z","title":"VideoAgent : Self-improving video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.256971Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:9ff137ebaa264ab5641d76a8c2127b3cbfcdc718d478868dd5873543233843da","observation_id":"13d75b34-ae20-4441-806d-4682344e22b4","resolution":{"observed_at":"2026-08-07T06:07:24.256971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-18T15:44:36.014181Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-07T06:07:24.262152Z","title":"ANOLE : An open, autoregressive, native large multimodal models for interleaved image-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.262152Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:174fc438deb429a58f00be50eec4a6845852c6e14aa5481e0d7af83b4c75f9e5","observation_id":"e3caf459-b8b1-403e-a755-12a927bd2ff1","resolution":{"observed_at":"2026-08-07T06:07:24.262152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.727214Z","title":"LoRA : Low-rank adaptation of large language models","venue":null,"work_id":"59dddc39-c438-41ab-b1a3-9fc5073e349f","year":2022},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.267271Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:3ed284955ff8d3076a73cd831716b94ffea5ca6bc476fdf47264a81e73c87391","observation_id":"32172cfe-5218-4da7-9b8b-0b6637d226e4","resolution":{"observed_at":"2026-08-07T06:07:24.731994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.709033Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":"beed5bb5-e2a4-434d-b14c-0f15328e36dc","year":2020},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.272518Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:1547d87a4ad0b3313c1f7b72e41ac5ab6aa4600479935e6c19bbf3a9a71edbd2","observation_id":"28e71d01-3eb4-46c8-9e6f-0f23089554fc","resolution":{"observed_at":"2026-08-07T06:07:24.715787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:07:24.277177Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.277177Z"},"links":{"citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:4be26b78fd723792cf2aeb18811252754e4e0fc24819ee2a2f51c1b50ee3087c","observation_id":"24fe666c-1b17-4bb7-8922-5bf0e22de8bf","resolution":{"observed_at":"2026-08-07T06:07:24.277177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.06006."}