{"as_of":"2026-08-16T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b689391576a5bc88daa99ce7d1a510ddc8b435cb802caf385114c9949b93d77","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:32:18.311152Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:59:33.470821Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T07:14:45.297196Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-08-07T14:25:41.406818Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models.arXiv preprint arXiv:2505.09694, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19017","last_updated":"2025-05-25T07:41:39Z","snapshot_observed_at":"2026-08-15T12:42:28.956942Z","submitted_at":"2025-05-25T07:41:39Z","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.406818Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2505.19017"},"observation_digest":"sha256:fb4ab176c71655a2f1fad849cfcd82984cd6329671ea529e3be28571f1a1e012","observation_id":"b0e13d2d-a1a0-4fb9-b323-c2c74444c496","resolution":{"observed_at":"2026-08-07T14:25:41.406818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:ed706ff6f34ac52684b1c37233a0148df551e548bf7d26c0ee1e21e2faeddd3d","observation_id":"e5a6beaa-dbf6-4530-92b9-d98899056ce9","resolution":{"observed_at":"2026-05-15T21:28:42.070186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-08-05T23:17:31.480573Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05636","last_updated":"2025-08-07T17:59:59Z","snapshot_observed_at":"2026-08-15T23:41:41.661423Z","submitted_at":"2025-08-07T17:59:59Z","title":"FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:31.480573Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2508.05636"},"observation_digest":"sha256:ae5c653918dc4d2ce047a48298c0e0b8a4869f800dc0f98b13e16865ca5371a6","observation_id":"f04fd008-207e-4eea-8d1f-860c823a51a4","resolution":{"observed_at":"2026-08-05T23:17:31.480573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-08-04T09:12:58.870000Z","title":"EWMBench: Evaluating scene, motion, and semantic quality in embodied world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-12T21:04:24.441891Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":255,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:58.870000Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:856f90adac4019b23fd8276f40a910d4503a6318906e33be54950012630adc30","observation_id":"f70a6874-ee4d-4b52-8d54-3d2c277da8a8","resolution":{"observed_at":"2026-08-04T09:12:58.870000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4e299b9409b1592989fabaa8687b84ede30d75a3e1e5c5a827b3104acc75d068","observation_id":"8af2157c-8527-42e4-97d2-2543d4aba109","resolution":{"observed_at":"2026-05-12T23:01:13.822345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-08-14T22:39:17.670914Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:6dc45a86349162fa16598ceac8b9b5b6ff04a93fc7833b87941f5c570656ae43","observation_id":"a9160140-5c88-48c4-9df3-c7cc44cfb751","resolution":{"observed_at":"2026-05-10T03:03:37.426810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-08-14T22:39:17.670914Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:dab8a478835cf3baca65bcdb000536e67dbdeee5da6d564188cca6aba4454657","observation_id":"895114f5-b0b4-49c0-bbe0-4b76d7701477","resolution":{"observed_at":"2026-05-15T06:19:50.132563Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2605.00080","last_updated":"2026-04-30T14:35:31Z","snapshot_observed_at":"2026-08-04T20:02:32.182599Z","submitted_at":"2026-04-30T14:35:31Z","title":"World Model for Robot Learning: A Comprehensive Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-09T20:38:12.709629Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2605.00080"},"observation_digest":"sha256:f85687c958d033f026a034ab3af133d8156a39056f25efabebfe66b1b676be35","observation_id":"47b96576-38f1-41b0-bbed-72f5ddf9dd5c","resolution":{"observed_at":"2026-05-11T15:11:04.944296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2605.06388","last_updated":"2026-05-07T15:05:26Z","snapshot_observed_at":"2026-08-12T15:42:05.987893Z","submitted_at":"2026-05-07T15:05:26Z","title":"Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T13:16:27.868477Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2605.06388"},"observation_digest":"sha256:5037ab1862ce5e552a3a3ee8d0442b447ccd74a69e826e47d1f70531e27f6c24","observation_id":"e6f3220b-1dfc-4698-8fc0-d2786da8db5c","resolution":{"observed_at":"2026-05-11T18:56:06.989949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":218,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:16e0860addc9359c0d93be4e55f50915fc76868da1d241c60b7bff056e3f7647","observation_id":"f74af6c3-2024-4eb3-b62c-5e87555dc5d1","resolution":{"observed_at":"2026-05-13T05:07:18.048616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2605.17912","last_updated":"2026-05-18T06:18:21Z","snapshot_observed_at":"2026-08-15T12:19:19.921672Z","submitted_at":"2026-05-18T06:18:21Z","title":"WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T10:59:54.879907Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2605.17912"},"observation_digest":"sha256:076ea7f8d67fc45c7f6b64404a30be7afbe3a6713291023d04164edb9168227d","observation_id":"3938bbd3-10d7-4d20-9b04-7540ddd0c076","resolution":{"observed_at":"2026-05-20T11:03:13.710716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2605.25874","last_updated":"2026-05-25T14:01:31Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T14:01:31Z","title":"WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T22:57:08.381846Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2605.25874"},"observation_digest":"sha256:a3d72ccc4b9b978d0ab7d7981bf55554286ed079eaf17ef9574c8c4247dfc04c","observation_id":"16ee687a-f32d-433e-8fe5-b67dad6cf808","resolution":{"observed_at":"2026-06-29T23:14:02.281233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2606.04463","last_updated":"2026-06-04T13:11:48Z","snapshot_observed_at":"2026-08-14T08:09:50.636779Z","submitted_at":"2026-06-03T05:16:41Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T06:35:26.480518Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2606.04463"},"observation_digest":"sha256:8a2ee62a39a68e0b7694854b0b7e83defbc98eeb50ec55d165b2444bab92d487","observation_id":"b62d0201-ca2a-45cf-84bc-912856de6892","resolution":{"observed_at":"2026-07-02T07:56:47.043947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2606.07687","last_updated":"2026-06-05T04:43:02Z","snapshot_observed_at":"2026-08-15T23:07:28.313154Z","submitted_at":"2026-06-05T04:43:02Z","title":"What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T22:38:40.686550Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2606.07687"},"observation_digest":"sha256:96cce5e8afe3f5d1a08064c60f2b830faa72b54bfec698ec16f6c67a7dca9b4b","observation_id":"6f905847-1740-461d-b600-5f37f01984b6","resolution":{"observed_at":"2026-07-02T16:27:09.556188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-08-14T19:43:16.696160Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:f6c3e9144bd6f5a1ecb35d10d58ebfc68247a241b7ff79d2156b9a0301210e18","observation_id":"f25a25dd-5b30-43e5-ab04-29b2905ad2ab","resolution":{"observed_at":"2026-07-03T05:47:41.326268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2606.15032","last_updated":"2026-06-28T03:48:42Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T00:21:21Z","title":"How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T10:31:37.108792Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2606.15032"},"observation_digest":"sha256:6dbd2a641d3d0b90a13b7f505a1ea86244f535f75d3fb1852cc23e9fefb2f588","observation_id":"f26f4b76-72d0-4262-abe4-0c1f666d324e","resolution":{"observed_at":"2026-06-30T10:34:36.414860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2607.06401","last_updated":"2026-07-07T15:31:32Z","snapshot_observed_at":"2026-08-14T01:34:53.290955Z","submitted_at":"2026-07-07T15:31:32Z","title":"A Definition and Roadmap for World Models","version":1},"reference_index":276,"source":"arxiv_source","source_observed_at":"2026-07-08T07:10:33.826140Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2607.06401"},"observation_digest":"sha256:665b04df7127b19afaed53e5b67ec250222baf2e4bfecafb646c0809d0322479","observation_id":"744454d5-cfbf-4b80-b371-a9c471a775bc","resolution":{"observed_at":"2026-07-08T07:14:45.298975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-08-04T03:23:59.374746Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models.arXiv preprint arXiv:2505.09694, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02603","last_updated":"2026-08-03T17:59:54Z","snapshot_observed_at":"2026-08-15T08:24:03.982326Z","submitted_at":"2026-08-03T17:59:54Z","title":"WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T03:23:59.374746Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2608.02603"},"observation_digest":"sha256:a2b699a30a39a88e9acf6b5ffdf608ea2f7433dd4c949d31a57b50036b883768","observation_id":"aac63865-6bc6-418c-a356-dbcaedd25d3a","resolution":{"observed_at":"2026-08-04T03:23:59.374746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-08-11T19:59:33.470821Z","title":"arXiv preprint arXiv:2505.09694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09298","last_updated":"2026-08-10T08:48:06Z","snapshot_observed_at":"2026-08-14T12:50:36.895258Z","submitted_at":"2026-08-10T08:48:06Z","title":"WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T19:59:33.470821Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2608.09298"},"observation_digest":"sha256:9f41d6218c3be56fdc103d9e9b694d1cf85f4dd5904521d673996e6a143716ac","observation_id":"3dacc1cd-dc0e-4712-9675-b03c11f62d2d","resolution":{"observed_at":"2026-08-11T19:59:33.470821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-08-11T15:34:09.175117Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models.arXiv preprint arXiv:2505.09694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09537","last_updated":"2026-08-10T12:35:59Z","snapshot_observed_at":"2026-08-15T17:48:34.749079Z","submitted_at":"2026-08-10T12:35:59Z","title":"verdi: retrieval is not transfer for continual world model optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:34:09.175117Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2608.09537"},"observation_digest":"sha256:08d4c7ee46c5300a78eae8417503e92e007bcd9e6edb6626807a894832b1df51","observation_id":"e1d3ddfc-15b8-4de3-9b1b-8aabe564aa29","resolution":{"observed_at":"2026-08-11T15:34:09.175117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.09694/citation-record","integrity":"/paper/2505.09694/integrity","json":"/paper/2505.09694/citation-record.json","paper":"/paper/2505.09694"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-15T21:32:18.120314Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.120314Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:861517fd5f11f124d77412f70e6a2f85046edde01f62ed9c4805fa47d3ec07d1","observation_id":"af106b22-a1b9-4796-b453-ce4c3b93c02e","resolution":{"observed_at":"2026-08-15T21:32:18.120314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:19.006881Z","title":"Agibot world.https://agibot-world.com, 2024","venue":null,"work_id":"ec1e0de8-ec94-486d-9cc6-3e8a966c194c","year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.125445Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:2635c48def06bf7cbdca8374536b412c32f4e8542865f798d81cfc6df63c534a","observation_id":"05fde287-c4c8-42d6-9bfa-9c69f88e0b5b","resolution":{"observed_at":"2026-08-15T21:32:19.011556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14651","last_updated":"2022-07-07T15:36:49Z","snapshot_observed_at":"2026-08-13T15:14:12.197118Z","submitted_at":"2022-06-29T13:45:03Z","title":"BoT-SORT: Robust Associations Multi-Pedestrian Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14651","snapshot_observed_at":"2026-08-15T21:32:18.130016Z","title":"Bot-sort: Robust associations multi-pedestrian tracking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.130016Z"},"links":{"cited_paper":"/paper/2206.14651","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:16c097d55dc637b7489fc5b5b2c458682a3ef258eda9b5c40e00773f0f67abc9","observation_id":"cc17c227-84af-44b2-a120-439ad2261b07","resolution":{"observed_at":"2026-08-15T21:32:18.130016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-13T00:13:12.479004Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-15T21:32:18.134881Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models.arXiv preprint arXiv:2405.04233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.134881Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:6a5e2f0406952cdd109fc84ab044b6d93c53fac3227212e709b556b46dcae454","observation_id":"dd04d171-e061-4f78-856d-6e2c5ff40718","resolution":{"observed_at":"2026-08-15T21:32:18.134881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-15T21:32:18.139732Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.139732Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:66c6d09dac64c5d23ddd21c6380d3ef96400e537cc0c3156b03ddbed5e2d7a50","observation_id":"add7aefd-73b7-4884-81bb-f6b8f3f837e7","resolution":{"observed_at":"2026-08-15T21:32:18.139732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.993034Z","title":"Video generation models as world simulators","venue":null,"work_id":"ec87df05-acb8-40a6-a568-5b2345409e1e","year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.144604Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:bd4d423ad63be877fa616798ca92d3f0ebe26462c4826afc847d11dbb9dcfcf6","observation_id":"384772eb-1bb1-471a-9a8c-20ed56148593","resolution":{"observed_at":"2026-08-15T21:32:18.997473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-15T21:32:18.149593Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.149593Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:f9730a47d849b83e2de4dd2e9cc2f95d4861d3cd932dad3cc6430252821b0d3f","observation_id":"ed2cc3b4-40b3-44be-b0be-89dc9a880e6d","resolution":{"observed_at":"2026-08-15T21:32:18.149593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.154335Z","title":"Videocrafter1: Open diffusion models for high-quality video generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.154335Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:732b7397a0f3666097ae0c67e0a9f070f752ed8a4ffd16418076fe5a2ef81f08","observation_id":"5ae448ee-2af6-4d13-84a1-6e080ae11e6b","resolution":{"observed_at":"2026-08-15T21:32:18.154335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.158811Z","title":"Yolo-world: Real- time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.158811Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:cd782594ca7a1b8e6efda99fb4e21891388d452610caa20ce8143eb2536093a1","observation_id":"c337ac96-c27d-4e2b-af1c-bdac701b9069","resolution":{"observed_at":"2026-08-15T21:32:18.158811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15461","last_updated":"2025-06-10T08:08:33Z","snapshot_observed_at":"2026-08-12T22:19:09.250188Z","submitted_at":"2024-10-20T18:24:00Z","title":"EVA: An Embodied World Model for Future Video Anticipation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15461","snapshot_observed_at":"2026-08-15T21:32:18.163059Z","title":"Eva: An embodied world model for future video anticipation.arXiv preprint arXiv:2410.15461, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.163059Z"},"links":{"cited_paper":"/paper/2410.15461","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:fe86cbe3b7c64c3ec2560ee83749453926f9705f3ca6d1017d3fbf8493ae092d","observation_id":"0b0625a9-c79f-4f9e-9af4-7944b37c88a8","resolution":{"observed_at":"2026-08-15T21:32:18.163059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-15T21:32:18.167839Z","title":"Tc-bench: Benchmarking temporal compositionality in text-to-video and image-to-video generation.arXiv preprint arXiv:2406.08656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.167839Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:eba171c616d44c8b9eb5520bb0e770af4bf3a779890970d9640c6c2ee465d79a","observation_id":"d25f1e89-8a0d-4aed-b5f9-cd3fd504d497","resolution":{"observed_at":"2026-08-15T21:32:18.167839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-15T21:32:18.172247Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.172247Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:eddd88de261677cec1b6aa540bbc3c47add8a017b4103fe739f654fd019fdc61","observation_id":"4b17d9a9-327d-4774-a504-71239279879d","resolution":{"observed_at":"2026-08-15T21:32:18.172247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-15T21:32:18.176712Z","title":"Ltx-video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.176712Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:59c4d6e1b5008c40d307823f9fe826f54d3d8a0fa3b14377d61f63bc356d6d47","observation_id":"2cb7d067-b554-4516-8f8e-7fbbb0aed817","resolution":{"observed_at":"2026-08-15T21:32:18.176712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.962619Z","title":"Hailuoai.https://hailuoai.video/, 2025","venue":null,"work_id":"96ecfc9f-7594-4e4c-991c-a5a7e0dac748","year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.181321Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:f9353bbc568e2c741a433925a0f551e61b473574650eb0f0a1a21218953d235f","observation_id":"05147f67-66bd-490d-a153-e0832e5e55d6","resolution":{"observed_at":"2026-08-15T21:32:18.966830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.948312Z","title":"GANs trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"e0cf08fe-ee75-4eab-ac13-733391d8eae7","year":2017},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.185802Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:1f9603036f292125108d533e17f270b2b5b04be1e45e4fcf28bd93d11e437586","observation_id":"213cc92f-54cb-47d0-a017-d77211f84e34","resolution":{"observed_at":"2026-08-15T21:32:18.952819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.189902Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.189902Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:562989444635f3f15e67633098f3afdbd30039d9c628fadb92a70e458d911f32","observation_id":"460c4f63-951f-47a7-a804-27338acc0b24","resolution":{"observed_at":"2026-08-15T21:32:18.189902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.194280Z","title":"Enerverse: Envisioning embodied future space for robotics manipulation.arXiv preprint arXiv:2501.01895, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.194280Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:de2a7cbbd0595c85a08fe0b4ac440869d724f6ce3d792765e567da27e89ef16e","observation_id":"dd6ac336-6271-4f41-b31e-6b40c4622f0a","resolution":{"observed_at":"2026-08-15T21:32:18.194280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.925740Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"8caba054-54cf-43eb-a05b-e9eed8de2989","year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.198312Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:376289f7919318b975c938098092e83e191cf22a923ff1714e94cb9e38a8c211","observation_id":"0eae3214-6cff-48c3-aa7f-14f3c2d6af34","resolution":{"observed_at":"2026-08-15T21:32:18.930194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-15T21:32:18.202701Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models.arXiv preprint arXiv:2411.13503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.202701Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:04057ff1ba7cda1d8ecc7d050f4968edeb7e367aa6a371e135a00bed6ca4959c","observation_id":"352afd6d-4e9f-4530-99c2-564c768a0fa2","resolution":{"observed_at":"2026-08-15T21:32:18.202701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.911825Z","title":"T2vbench: Benchmarking temporal dynamics for text-to-video generation","venue":null,"work_id":"c8203184-a8d0-4bed-abe1-2b3e45fff9eb","year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.207218Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:03a21e18e1207d727b278d6de3f8cd029accbbc46a40e2e4d1d4439a70c98536","observation_id":"862fa674-1ae2-4a2a-80e8-323f12eb1e45","resolution":{"observed_at":"2026-08-15T21:32:18.916259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T21:32:18.211424Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.211424Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:e8fa77bffb5a3fb7cf5b3248068c6623062a7dde64e731df30922b128bad4a39","observation_id":"f4e3b2d9-64a9-4ace-98f6-855d0ee29ac1","resolution":{"observed_at":"2026-08-15T21:32:18.211424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.898626Z","title":"Kling.https://app.klingai.com/cn/, 2025","venue":null,"work_id":"d8c27c50-761a-4b55-a5a8-cd42e2a28b43","year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.216167Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:eb802be524a75477823acb9dfbbcd0afa0248270413e765ca25794472e38c4bd","observation_id":"8a4a619f-2f7e-42e6-8b45-2ad2ec79cc63","resolution":{"observed_at":"2026-08-15T21:32:18.902877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10076","last_updated":"2025-03-16T14:50:16Z","snapshot_observed_at":"2026-08-07T17:08:03.377778Z","submitted_at":"2025-03-13T05:54:42Z","title":"VMBench: A Benchmark for Perception-Aligned Video Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10076","snapshot_observed_at":"2026-08-15T21:32:18.220147Z","title":"Vmbench: A benchmark for perception-aligned video motion generation.arXiv preprint arXiv:2503.10076, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.220147Z"},"links":{"cited_paper":"/paper/2503.10076","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:5316e668be677787525d11680807c9dfbb3e9a0a7fa4529b9b0fc97733bf75f3","observation_id":"72155135-7e62-4f8b-9c65-df44ed6607f0","resolution":{"observed_at":"2026-08-15T21:32:18.220147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.884291Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"e4b146ba-4f3e-4358-a17b-928f6bb93212","year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.224448Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:372ff4e04f3244433fbf99677110324222c6c83b706864859dcd431c58e7e7c0","observation_id":"56994a53-06d1-4a5e-81a5-48d1b1fb5740","resolution":{"observed_at":"2026-08-15T21:32:18.888945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-15T21:32:18.229467Z","title":"Towards world simulator: Crafting physical commonsense-based benchmark for video generation.arXiv preprint arXiv:2410.05363, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.229467Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:7287a85f5cdb48da12bdecb4cd3547a13a440f67451be442dcd0a5f4630e2f6c","observation_id":"866dc7b8-4a29-4224-814a-2c701b73922e","resolution":{"observed_at":"2026-08-15T21:32:18.229467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-14T09:57:44.505326Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-15T21:32:18.234262Z","title":"Do generative video models learn physical principles from watching videos?arXiv preprint arXiv:2501.09038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.234262Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:ec67675d2068da081180020a6b64c82834e243c66fdf195c16cb26802b664e86","observation_id":"9114925f-146d-4782-af49-38d4e746b27e","resolution":{"observed_at":"2026-08-15T21:32:18.234262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.238750Z","title":"Dynamic time warping.Information retrieval for music and motion, pages 69–84, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.238750Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:c2f792bf2620967b9c2687a6fd5175af38338b3bdec179d327a43a3943544086","observation_id":"22c4af62-7d54-402b-b08a-503f0a48c916","resolution":{"observed_at":"2026-08-15T21:32:18.238750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T21:32:18.242962Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.242962Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:24cc4829c1d258cb266451188e0b51ca4c462bb7f16a5e1cf453f6778c0f095f","observation_id":"cfc4de8f-f8bf-4bc2-a9b5-ee64d9b8f9a4","resolution":{"observed_at":"2026-08-15T21:32:18.242962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-14T22:40:32.716624Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-15T21:32:18.247288Z","title":"Open-sora 2.0: Training a commercial-level video generation model in200k.arXiv preprint arXiv:2503.09642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.247288Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:efd349a37ef05d75375a647e53f9c7a9c870ce2c5c3d157df6dd0ca1c3f4a2bb","observation_id":"3bca0af9-1ef6-475a-aa81-69c20c505582","resolution":{"observed_at":"2026-08-15T21:32:18.247288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-15T11:21:25.961227Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-15T21:32:18.251877Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation.arXiv preprint arXiv:2402.04324, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.251877Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:8f3925701568b52fed3dd2a932bcc045ab86eebf4253845b119221d744ccf8db","observation_id":"02dcdb2d-2833-45d9-b127-20242b58f7ac","resolution":{"observed_at":"2026-08-15T21:32:18.251877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.859813Z","title":"Improved techniques for training gans","venue":null,"work_id":"bda30abd-d853-4867-858d-c7f5ea63e69b","year":2016},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.256437Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:8e564291230c9912faf39d93793529163e938e188d49e4d0c6c318f3892082f8","observation_id":"dae76722-d144-4c71-84c9-b6cb0c7eb119","resolution":{"observed_at":"2026-08-15T21:32:18.864398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.845328Z","title":"Hausdorff distances and interpolations.Computational Imaging and Vision, 12:107–114, 1998","venue":null,"work_id":"44a2a91b-5e0f-40d4-897d-7f1fd9d2315d","year":1998},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.260643Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:2a8cf6bec1ff92f54953597a7c7116345cd48e71abed6a066f602a8bb7719fa9","observation_id":"d121c660-5154-4e2d-bd54-0b396a84d9ea","resolution":{"observed_at":"2026-08-15T21:32:18.850075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T21:32:18.265144Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.265144Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:75a4b29b99ec1049bf957a20e2bb4ae8b41be8b1f7f972dafd7a11f878f6d128","observation_id":"79c45a92-2cb0-429f-b521-252eb1fffba7","resolution":{"observed_at":"2026-08-15T21:32:18.265144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-14T09:31:46.610962Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-15T21:32:18.269637Z","title":"T2v-compbench: A comprehensive benchmark for compositional text-to-video generation.arXiv preprint arXiv:2407.14505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.269637Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:8e22f3e9799d6b725d7f24420f5211391dfb43350fce4f689b702231c3c86113","observation_id":"d2f68e3a-abfc-471b-944a-eade825eb42d","resolution":{"observed_at":"2026-08-15T21:32:18.269637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.829913Z","title":"FVD: A new metric for video generation","venue":null,"work_id":"4a298fdd-038c-40ed-b9eb-c2eb7b69a017","year":2019},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.274824Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:c3b0e53409a13f5f118dba6efeb1d21cd2c7102f878a6b0e23149a2458523aa2","observation_id":"da876a4f-4d20-4e8c-af5d-e625b8c7d46f","resolution":{"observed_at":"2026-08-15T21:32:18.835415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.815577Z","title":"The wasserstein distances.Optimal transport: old and new, pages 93–111, 2009","venue":null,"work_id":"a2af7905-9b8b-4167-9cbe-440a877dfc0b","year":2009},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.279341Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:2dca5c550cc91797a06cf42e598642fc93eb2f9f098924866bdab820b8e9a0bb","observation_id":"24369ce9-0085-4db4-b4a7-bc6be95ee13c","resolution":{"observed_at":"2026-08-15T21:32:18.820401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.801250Z","title":"A framework for the greedy algorithm.Discrete Applied Mathematics, 121(1-3):247–260, 2002","venue":null,"work_id":"767233a4-b344-4ff5-95e6-fd2d66db1dfa","year":2002},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.283466Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:c4ead9acca368ba2da39f2cfea2d0ec4ab98507202c456e70f3056a5f4ccaf8b","observation_id":"29a2dc8e-47f3-445b-845b-0896b224ee5c","resolution":{"observed_at":"2026-08-15T21:32:18.805765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.287802Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.287802Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:a4643edecf5c2f7ab133837b0da0c4719c45461bed5fdb817af09128d83260b4","observation_id":"b8e3868c-4009-46aa-8baa-0e4d4de80907","resolution":{"observed_at":"2026-08-15T21:32:18.287802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-15T21:32:18.291958Z","title":"Learning interactive real-world simulators.arXiv preprint arXiv:2310.06114, 1(2):6, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.291958Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:9ee961c2c0d2e1df8e889c657b2ca891fae0c25cd9ed11eebca9fa3dfc5fd3d3","observation_id":"1ca9943e-bd5b-4baa-b92f-82b252cafa9e","resolution":{"observed_at":"2026-08-15T21:32:18.291958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-15T21:32:18.296502Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection.arXiv preprint arXiv:2203.03605, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.296502Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:4d6efa7be035b26d8ff1cb3bc2eea37b4a30827c586e9b16c99c12fc9ead12b5","observation_id":"614279b1-2146-477c-b2d0-d3aee4eaef05","resolution":{"observed_at":"2026-08-15T21:32:18.296502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.776214Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models, 2023","venue":null,"work_id":"0a8c77ff-4f40-4fd9-906b-76ccf54b6f8b","year":2023},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.301983Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:56e724e649f9fb16dca2d049f016121f7462bd1cd04fd2e266c616a12add703a","observation_id":"313341b8-f503-49f8-9172-eaccfa070e6e","resolution":{"observed_at":"2026-08-15T21:32:18.782351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:18.306475Z","title":"Open-sora: Democratizing efficient video production for all, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.306475Z"},"links":{"citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:a5d4b3e74bef267cd33216b85ab6f3c8492eab647c26c2ecd0b720c22d616a3c","observation_id":"51bbb5ad-cb36-4750-81b8-0ba349c7e14e","resolution":{"observed_at":"2026-08-15T21:32:18.306475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-12T22:44:50.325579Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-15T21:32:18.311152Z","title":"Keep the first-person view of the robot unchanged. Keep the first frame of this video unchanged","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:18.311152Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2505.09694"},"observation_digest":"sha256:136c4dfcbedc947f0e8313a8176a03cbeb30408c95534835ee5907df2f058685","observation_id":"b8f2f362-e5cf-4da1-8e75-8b4c74b9fc2d","resolution":{"observed_at":"2026-08-15T21:32:18.311152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T21:24:27.387484Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 20 inbound Pith citation observations for arXiv:2505.09694."}