{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ZFQUZ67HDSIV656BCR2EL46AAL","short_pith_number":"pith:ZFQUZ67H","schema_version":"1.0","canonical_sha256":"c9614cfbe71c915f77c1147445f3c002f2a374f62df4c8d5046bab776791e6f9","source":{"kind":"arxiv","id":"2502.20694","version":1},"attestation_state":"computed","paper":{"title":"WorldModelBench: Judging Video Generation Models As World Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Dacheng Li, Hongxu Yin, Ion Stoica, Joseph E. Gonzalez, Justin Wong, Michael Luo, Shiyi Cao, Shuo Yang, Song Han, Xiaolong Wang, Yao Lu, Yukang Chen, Yunhao Fang","submitted_at":"2025-02-28T03:58:23Z","abstract_excerpt":"Video generation models have rapidly progressed, positioning themselves as video world models capable of supporting decision-making applications like robotics and autonomous driving. However, current benchmarks fail to rigorously evaluate these claims, focusing only on general video quality, ignoring important factors to world models such as physics adherence. To bridge this gap, we propose WorldModelBench, a benchmark designed to evaluate the world modeling capabilities of video generation models in application-driven domains. WorldModelBench offers two key advantages: (1) Against to nuanced "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.20694","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-02-28T03:58:23Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"7d27852f5a72b4d6a38db62a36ead8756ed94cdfb09a2d8caacf3f5fd12c69eb","abstract_canon_sha256":"0d55c9103dc305f1cfdca41c2001697abbf0c506ed4072a24b7e4fdfee3f8e51"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:21:37.924729Z","signature_b64":"QFX3U5nESlyKarJVLCWal37R6ckUrxnDDE2DVl9FfkExXbYIW2MA112PUUfrquMcy33tojxmsxYabxzqyZieCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c9614cfbe71c915f77c1147445f3c002f2a374f62df4c8d5046bab776791e6f9","last_reissued_at":"2026-07-05T10:21:37.924217Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:21:37.924217Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"WorldModelBench: Judging Video Generation Models As World Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Dacheng Li, Hongxu Yin, Ion Stoica, Joseph E. Gonzalez, Justin Wong, Michael Luo, Shiyi Cao, Shuo Yang, Song Han, Xiaolong Wang, Yao Lu, Yukang Chen, Yunhao Fang","submitted_at":"2025-02-28T03:58:23Z","abstract_excerpt":"Video generation models have rapidly progressed, positioning themselves as video world models capable of supporting decision-making applications like robotics and autonomous driving. However, current benchmarks fail to rigorously evaluate these claims, focusing only on general video quality, ignoring important factors to world models such as physics adherence. To bridge this gap, we propose WorldModelBench, a benchmark designed to evaluate the world modeling capabilities of video generation models in application-driven domains. WorldModelBench offers two key advantages: (1) Against to nuanced "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.20694","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.20694/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.20694","created_at":"2026-07-05T10:21:37.924278+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.20694v1","created_at":"2026-07-05T10:21:37.924278+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.20694","created_at":"2026-07-05T10:21:37.924278+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZFQUZ67HDSIV","created_at":"2026-07-05T10:21:37.924278+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZFQUZ67HDSIV656B","created_at":"2026-07-05T10:21:37.924278+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZFQUZ67H","created_at":"2026-07-05T10:21:37.924278+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":34,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2607.06401","citing_title":"A Definition and Roadmap for World Models","ref_index":230,"is_internal_anchor":true},{"citing_arxiv_id":"2607.05352","citing_title":"Multiplayer Interactive World Models with Representation Autoencoders","ref_index":238,"is_internal_anchor":true},{"citing_arxiv_id":"2604.22748","citing_title":"Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond","ref_index":219,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27537","citing_title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.16533","citing_title":"Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11129","citing_title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27537","citing_title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27537","citing_title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14843","citing_title":"MechVerse: Evaluating Physical Motion Consistency in Video Generation Models","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27537","citing_title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.15032","citing_title":"How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25874","citing_title":"WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27589","citing_title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30346","citing_title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29360","citing_title":"MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31590","citing_title":"TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23699","citing_title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2602.13294","citing_title":"VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17912","citing_title":"WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19242","citing_title":"PhyWorld: Physics-Faithful World Model for Video Generation","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2511.17792","citing_title":"Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2511.18373","citing_title":"MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2602.11075","citing_title":"RISE: Self-Improving Robot Policy with Compositional World Model","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19092","citing_title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15185","citing_title":"Quantitative Video World Model Evaluation for Geometric-Consistency","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL","json":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL.json","graph_json":"https://pith.science/api/pith-number/ZFQUZ67HDSIV656BCR2EL46AAL/graph.json","events_json":"https://pith.science/api/pith-number/ZFQUZ67HDSIV656BCR2EL46AAL/events.json","paper":"https://pith.science/paper/ZFQUZ67H"},"agent_actions":{"view_html":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL","download_json":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL.json","view_paper":"https://pith.science/paper/ZFQUZ67H","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.20694&json=true","fetch_graph":"https://pith.science/api/pith-number/ZFQUZ67HDSIV656BCR2EL46AAL/graph.json","fetch_events":"https://pith.science/api/pith-number/ZFQUZ67HDSIV656BCR2EL46AAL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL/action/storage_attestation","attest_author":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL/action/author_attestation","sign_citation":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL/action/citation_signature","submit_replication":"https://pith.science/pith/ZFQUZ67HDSIV656BCR2EL46AAL/action/replication_record"}},"created_at":"2026-07-05T10:21:37.924278+00:00","updated_at":"2026-07-05T10:21:37.924278+00:00"}