{"as_of":"2026-08-19T03:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f86c7fd57da591d538801a1b4fc3553a13550e32caaffb96ba944df87180ab4f","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:28:20.248452Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T07:10:33.826140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T07:14:45.189730Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"cited_work":{"arxiv_id":"2605.19242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19242","snapshot_observed_at":"2026-07-08T07:14:45.189730Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","venue":"cs.CV","work_id":"de5785e4-8ad3-4972-9a3e-c753994ba319","year":2026},"citing_paper":{"arxiv_id":"2607.06401","last_updated":"2026-07-07T15:31:32Z","snapshot_observed_at":"2026-08-18T13:58:20.070179Z","submitted_at":"2026-07-07T15:31:32Z","title":"A Definition and Roadmap for World Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-08T07:10:33.826140Z"},"links":{"cited_paper":"/paper/2605.19242","citing_paper":"/paper/2607.06401"},"observation_digest":"sha256:2a3ed1bd8d0909cfc2a05db5724cf98086c9c43ea79f86358913816644ec854c","observation_id":"3701c19d-d1f4-4fc6-8a03-473ff01b4756","resolution":{"observed_at":"2026-07-08T07:14:45.191861Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19242/citation-record","integrity":"/paper/2605.19242/integrity","json":"/paper/2605.19242/citation-record.json","paper":"/paper/2605.19242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":"2402.17177","doi":"10.48550/arxiv.2402.17177","metadata_source":"pith","pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","venue":"cs.CV","work_id":"49aeafea-5763-4b8e-aff4-8fa617aacb1f","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:5dfc013197338a426ca91aa8f9f70566ecbbf723b95d64b2e23c3be912af1a40","observation_id":"a243100c-b0b7-43c1-b2e2-334f733df2c4","resolution":{"observed_at":"2026-05-20T07:33:07.628793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:f89bbed6fd74ac44fde85b54a200b3db3a6b370c44c7aeba78956fc42006f842","observation_id":"dbac46c9-33bb-4c4c-8dfe-5866633ec6b0","resolution":{"observed_at":"2026-05-20T07:33:07.615118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:e67a6ae08428b10de205a0f7b3a9d058bf5981e306df88c888cfd120efc2d7c2","observation_id":"69863998-34f2-4cb3-8c98-2f504caefe43","resolution":{"observed_at":"2026-05-20T07:33:07.612602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:33d68e79b0eb8633ce8cd19030bc7f79f924147f415b546fb61684bac975433f","observation_id":"4f61161b-69bc-4e99-b58a-21de0deb8575","resolution":{"observed_at":"2026-05-20T07:33:07.573153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:f7cf04946c8cfc8e41eebf022bc892b21a9b183f08881138100c14746104f52f","observation_id":"ef4eaf4e-8cce-4cba-aa86-4fef9eae7410","resolution":{"observed_at":"2026-05-20T07:33:07.578777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.420509Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"4c1a2b42-22ca-41d3-ac97-12604d04ae6d","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:dfb17a0eac9cfd7256f47806d6db68ff7b163d8d1d44ac9572894305fe27017b","observation_id":"47e5b0af-03d1-4c8e-a2a4-10e4aacd9b11","resolution":{"observed_at":"2026-05-20T07:33:23.999229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding world or predicting future? a comprehensive survey of world models.ACM Computing Surveys, 58(3):1–38","venue":null,"work_id":"81abea93-dcb3-42b9-8bf6-d7cdd4e15b06","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:e4d5c4de23a724ba6274568593248130bb21bb2488b61b79ca028ebd282f7d62","observation_id":"b0eb3ff4-f7a9-4687-b518-b561f545bd77","resolution":{"observed_at":"2026-05-20T07:33:23.997551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-12T21:04:24.441891Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"cited_work":{"arxiv_id":"2510.16732","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16732","snapshot_observed_at":"2026-07-04T17:29:59.537323Z","title":"A comprehensive survey on world models for embodied ai","venue":"cs.CV","work_id":"d4ba9e8d-69e0-462a-b353-627172c1e415","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2510.16732","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:24d129113a8cf11aaab0a0da53b83bb4aa115ea5fb544412dd5a01b03093d403","observation_id":"b168b687-71c0-4596-935d-8fa870bf346f","resolution":{"observed_at":"2026-06-29T01:14:24.976532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.08585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:57:38.090507Z","title":"Simulating the visual world with artificial intelligence: A roadmap","venue":null,"work_id":"77d58b3a-df21-4fe8-a4c0-6bfd512e7697","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:1e6fe834cae811ff5e3b2c3a4b2be147148b916970e35b080a8f1e5a7af1c889","observation_id":"72ea1d9f-91aa-4c88-bc1c-f78fecaa06e2","resolution":{"observed_at":"2026-05-20T07:33:07.589867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00917","last_updated":"2025-09-03T01:44:58Z","snapshot_observed_at":"2026-08-15T04:49:35.866914Z","submitted_at":"2025-07-01T16:23:00Z","title":"A Survey: Learning Embodied Intelligence from Physical Simulators and World Models","version":3},"cited_work":{"arxiv_id":"2507.00917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00917","snapshot_observed_at":"2026-07-08T13:14:53.255674Z","title":"A survey: Learning embodied intelligence from physical simulators and world models","venue":"cs.RO","work_id":"5811fe6a-47c9-417e-9cd7-dbd39f7ddd64","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2507.00917","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:46114fed1e6788d8db813208d3dac12025409e031006a220ac2e5ccc2754ecd4","observation_id":"dace664c-aa55-47b6-b0a2-dd75fa405e78","resolution":{"observed_at":"2026-05-20T07:33:07.610198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:14:21.618975Z","title":"Open-source multimodal moxin models with moxin-vlm and moxin-vla","venue":null,"work_id":"8b851cc7-8658-46d4-a4ce-0d7544b7e127","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:8ba5cc4cd173c63e28ca895b09d51c0348e7e9102907f9c114611a98e6707948","observation_id":"fb8c8f22-cbd2-476d-9e90-5a9de5290a75","resolution":{"observed_at":"2026-05-20T07:33:07.553889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"cited_work":{"arxiv_id":"2412.06845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06845","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"7b fully open source moxin-llm/vlm–from pretraining to grpo-based reinforcement learning enhancement","venue":null,"work_id":"4add7a55-26da-4779-ad27-59ae39e761fd","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2412.06845","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:0987de85edd5c4b8d8a47329c1587b218177942dcfa04d2c1b4615cc19860587","observation_id":"bde30324-447d-45fa-b538-054dd951d0a9","resolution":{"observed_at":"2026-05-20T07:33:07.545335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21765","last_updated":"2025-03-27T17:58:33Z","snapshot_observed_at":"2026-08-16T12:46:11.670108Z","submitted_at":"2025-03-27T17:58:33Z","title":"Exploring the Evolution of Physics Cognition in Video Generation: A Survey","version":1},"cited_work":{"arxiv_id":"2503.21765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21765","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the evolution of physics cognition in video generation: A survey.arXiv preprint arXiv:2503.21765","venue":null,"work_id":"ae07fc41-a2ac-4162-ae3c-ede5acc2bd4e","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2503.21765","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:44dc419915a506ceeab62a933e126e8e978685429b40db2310c9dd45d8ccad8e","observation_id":"10f0360c-90d3-41a6-8c6c-d45776729e8b","resolution":{"observed_at":"2026-05-20T07:33:07.537094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"cited_work":{"arxiv_id":"2501.10928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10928","snapshot_observed_at":"2026-07-04T13:19:51.110536Z","title":"Generative physical AI in vision: A survey","venue":null,"work_id":"34f60193-442f-42cd-9108-74cfa8af09e6","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2501.10928","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:559fb35197bdeca9dd301372e140e8d7d11a8b2aaab521b14d7079861cff3536","observation_id":"caff9054-6f0d-4667-a594-d415a215614b","resolution":{"observed_at":"2026-05-20T07:33:07.539755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From specialist to generalist: A comprehensive survey on world models.Authorea Preprints","venue":null,"work_id":"22ca955b-9c34-4157-a82d-689f4908baff","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:2f88a6083d1edead2ef8a1f938f6045837803b71429c7c2eec6c4a091095eced","observation_id":"bd2c83cc-563e-45d0-aa7c-f1d7083a7278","resolution":{"observed_at":"2026-05-20T07:33:24.000912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to model the world: A survey of world models in artificial intelligence.Authorea Preprints","venue":null,"work_id":"25a99c27-50c2-46b5-938e-21a662bd976f","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:b58f0a87ab479c35000c7e85b59de17542a0057f68d94f7b6d8cffa385c61c82","observation_id":"f909970c-5778-4f22-acf2-a95a4dfbdb3f","resolution":{"observed_at":"2026-05-20T07:33:23.995798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Squat: Quant small language models on the edge","venue":null,"work_id":"38c5ed20-f03d-4feb-9858-7f8034deed87","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:d5a8a0c25895d4018f896a85668cd16788d8600fadce0c1c81aad1a09679d627","observation_id":"f4b160fd-9140-4d17-838c-7e05c5f750ca","resolution":{"observed_at":"2026-05-20T07:33:24.004617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pruning foundation models for high accuracy without retraining","venue":null,"work_id":"09202659-1f3e-4acf-b31f-9e2399bd4b85","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:9c900cd12c277d325de88dce537527ba1aee50c975f28f5913683afc56555d4a","observation_id":"040b0f30-9bcc-47a4-8d07-a98bcc4d105a","resolution":{"observed_at":"2026-05-20T07:33:23.990665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Search for efficient large language models","venue":null,"work_id":"b72b2158-88fe-4fda-a649-384a3f95ac8c","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:ca771e8f968319937d83cabafc4256f97478f4fea97520ce7e00d4ae9ece137b","observation_id":"dcf7a5e2-958c-4585-8bf4-f5da809eca32","resolution":{"observed_at":"2026-05-20T07:33:23.994066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quartdepth: Post-training quantization for real-time depth estimation on the edge","venue":null,"work_id":"b6b07494-de43-4cbb-ba00-11ad31e53e0d","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:f63ce3acbdb2ea6e41521ba44c9a88b181381f0160cb99129c0850f474c2a5a9","observation_id":"1e838db4-0b61-47bb-b7e2-79f236ccbfe5","resolution":{"observed_at":"2026-05-20T07:33:24.002714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18418","last_updated":"2025-05-14T18:27:05Z","snapshot_observed_at":"2026-08-16T13:48:30.228926Z","submitted_at":"2024-05-28T17:57:23Z","title":"Hierarchical World Models as Visual Whole-Body Humanoid Controllers","version":3},"cited_work":{"arxiv_id":"2405.18418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical world models as visual whole-body humanoid controllers","venue":null,"work_id":"365abaae-10d4-43ae-8ba8-0d6a60d0160f","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2405.18418","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:f9ef4c0c31faa77887fd9ae265b18b1af452c3db19e56df70d9346c2c2922c67","observation_id":"4b87c62e-455c-45df-bf3b-1db012641db0","resolution":{"observed_at":"2026-05-20T07:33:07.548310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:37.286913Z","title":"Learning latent action world models in the wild","venue":null,"work_id":"5c37276c-cb5d-42ec-a70c-355a2e2eb32f","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:cbf77a1a50a2f9bf3d07d74b00557b76913269eb5eaed31204e0fafabdcb944d","observation_id":"e1e3d42c-8b2a-46a1-9028-35a7909cd14e","resolution":{"observed_at":"2026-05-20T07:33:07.533053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10553","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:29:15.503264Z","title":"arXiv preprint arXiv:2601.10553 , year=","venue":null,"work_id":"49c8b7d1-54c8-4b8e-a2d1-2bcc3750e580","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:1844e118cbfe6b80538afc35807c90be082b241c5bee42364a15e60499e53757","observation_id":"4acf341c-0fd4-47f1-a9f5-413b98451037","resolution":{"observed_at":"2026-05-20T07:33:07.620861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-18T01:37:22.468162Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:7f74ab3130562edb06237b688dd211e21a2b894c30b0df75e539b7537621b3e2","observation_id":"018a42f3-e417-4a93-a6f4-d1d56cdc4cb7","resolution":{"observed_at":"2026-05-20T07:33:07.600904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":"2511.04670","doi":"10.48550/arxiv.2511.04670","metadata_source":"pith","pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","venue":"cs.CV","work_id":"f715ecad-ad1d-4060-9a4c-bdb41257ef61","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:79c95243505491a80cdf2dd105935ac27500b202235aa922409779c9d467be0f","observation_id":"b91a31d6-730a-49cb-88f7-831c0919cd02","resolution":{"observed_at":"2026-05-20T07:33:07.521126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:58:58.077170Z","title":"Vagen: Reinforcingworldmodelreasoningformulti-turnvlm agents.arXivpreprint","venue":null,"work_id":"d96823c2-b5e8-4fd0-a576-a93abd6858b0","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:d56b294a5c7a6daf6a6565b33cc0ad16d88e033d53cfefee96bd57c978b9405c","observation_id":"5b37fdd0-2aa8-41d2-aac4-09e63f2f7e24","resolution":{"observed_at":"2026-05-20T07:33:07.524250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.636493Z","title":"arXiv preprint arXiv:2601.03782 (2026)","venue":null,"work_id":"13d28a56-ef0f-4caa-9fa7-9f494d91f062","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:d12e5ccfe383ac3f94b4a1d1a8f11892aee45375eb79a83ddab9b85413a6510d","observation_id":"a6f9cb59-6c50-44d8-86a7-e073954cb883","resolution":{"observed_at":"2026-05-20T07:33:07.530191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse learning for state space models on mobile","venue":null,"work_id":"7616cdeb-69c1-4bad-8c2e-0b4911de12ac","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:d23b7f6a393d3087b2469e03e4f96c3962cb141f2f2014bb7de27ba0e8dd7a5e","observation_id":"903b7c8e-3ab8-4d44-9234-6385fd89c480","resolution":{"observed_at":"2026-05-20T07:33:23.992468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring token pruning in vision state space models","venue":null,"work_id":"cbb8415b-eb18-4ef3-8616-2da3dc0ef6bd","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:7f5e09492e3de4d3bc30a2fd55ec6ef0e0aea997d364e618dee685e437e68eef","observation_id":"6e57d839-7afd-4229-abb2-bd774f092a6a","resolution":{"observed_at":"2026-05-20T07:33:23.985417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking token reduction for state space models","venue":null,"work_id":"8bdba7e9-6bd8-4e93-9d8d-58d042264726","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:524f6f05c94bb8eb76408ffd8a105d4e0a39b19ede167eb383e3b2876a166b89","observation_id":"a74ace31-f8d9-4ed5-bb9b-435b044f7d52","resolution":{"observed_at":"2026-05-20T07:33:23.987055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cocopie: enabling real-time ai on off-the-shelf mobile devices via compression-compilation co-design","venue":null,"work_id":"41793c9c-eaa8-437f-bde4-a8d2fa0a7611","year":2021},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:843683e46e62a5d68e20c755a0e561dd0272c1fe7eacc3f21a02026275b39dd1","observation_id":"d49bb6d2-5ba1-4e59-b39d-69c208eecbc3","resolution":{"observed_at":"2026-05-20T07:33:23.988868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:14:21.588139Z","title":"Effective moe-based llm compression by exploiting heterogeneous inter-group experts routing frequency and information density","venue":null,"work_id":"978a30a7-01c4-4cbf-8bf4-8c78ee8a4ea3","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:ac7ee13141a62f200205e5c2f591cf60b352446b47ec0d1c39dd112940cb0fcf","observation_id":"44484835-d87a-40a3-b97c-de2df62e74e1","resolution":{"observed_at":"2026-05-20T07:33:07.604061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:2d15e47142a6dd6f006e630b2cf653f0810b7cbcc9d59c1f46f5c38f91eaa4f8","observation_id":"df3c2012-f541-4a6c-887a-c845b770dbd9","resolution":{"observed_at":"2026-05-20T07:33:07.607462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":"2601.20540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-10T08:36:59.816756Z","title":"Advancing Open-source World Models","venue":"cs.CV","work_id":"3446760e-6460-429e-82f6-6a5133ce4c8a","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:e7693a446ed86d1103ff7ebc52eaad234753c9352e75a3e2eaa3a270e8f0423e","observation_id":"dcb20b8a-4475-4a44-bbec-5350b4b7ddf1","resolution":{"observed_at":"2026-05-20T07:33:07.618043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05116","last_updated":"2026-07-08T17:09:24Z","snapshot_observed_at":"2026-08-18T09:02:13.147377Z","submitted_at":"2025-07-07T15:30:55Z","title":"VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting","version":5},"cited_work":{"arxiv_id":"2507.05116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05116","snapshot_observed_at":"2026-07-09T05:36:01.255549Z","title":"V ote: vision-language-action optimization with trajectory ensemble voting","venue":"cs.CV","work_id":"577786f7-7545-48fe-b085-1c37abd6a879","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2507.05116","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:f647fe4f2a3116274b8b1d0029fde3a1f6ddc3758210d53dffdbe1a3989b151b","observation_id":"d1936401-242f-4e89-94b2-bf03d872615a","resolution":{"observed_at":"2026-07-09T02:20:27.970763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18938","last_updated":"2025-06-02T14:37:52Z","snapshot_observed_at":"2026-08-17T18:46:14.022468Z","submitted_at":"2025-03-24T17:58:15Z","title":"AdaWorld: Learning Adaptable World Models with Latent Actions","version":4},"cited_work":{"arxiv_id":"2503.18938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18938","snapshot_observed_at":"2026-07-04T11:29:50.791557Z","title":"Adaworld: Learning adaptable world models with latent actions","venue":null,"work_id":"6c8e07c6-a0ca-44a1-abe4-13e96edab7b2","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2503.18938","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:3101ee124536a7e4eaecfc06ab055dead0d47ddb994b5418a405e72138e18533","observation_id":"90d011c2-cb5b-4d9c-aa3e-cce469f53a64","resolution":{"observed_at":"2026-05-20T07:33:07.598106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastcar: Cache attentive replay for fast auto-regressive video generation on the edge","venue":null,"work_id":"3c3a24a6-0572-40fb-846b-74e9d5a5ed76","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:5cb91f406dd66bb6243954dfae778ac09128519021c880e3e2bb473190ea8769","observation_id":"fe07e540-b813-4295-b783-984b027b1a96","resolution":{"observed_at":"2026-05-20T07:33:23.981356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numerical pruning for efficient autoregressive models.Proceedings of the AAAI Conference on Artificial Intelligence, 39(19):20418–20426, Apr","venue":null,"work_id":"04d583ee-5027-4cce-a605-52193cb82a85","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:e16bfaf83fdcc179fcf31180418436032afef352bc906ff3152b98ebea9f23e8","observation_id":"a5e7048f-1c29-493f-8d75-2eece2f1ddfc","resolution":{"observed_at":"2026-05-20T07:33:24.008451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lazydit: Lazy learning for the acceleration of diffusion transformers.Proceedings of the AAAI Conference on Artificial Intelligence, 39(19):20409–20417, Apr","venue":null,"work_id":"6dd13df5-8afd-46a2-96b8-cc8009060a17","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:3eb70dd958fce85c2964d992f0749da8ddeaa2a1249521a1966cd00b3f97a08c","observation_id":"aaf5a6e6-c5a0-44c4-b525-ba72b4946597","resolution":{"observed_at":"2026-05-20T07:33:23.979461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24113","last_updated":"2025-06-30T17:56:35Z","snapshot_observed_at":"2026-08-13T14:57:11.233080Z","submitted_at":"2025-06-30T17:56:35Z","title":"Epona: Autoregressive Diffusion World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2506.24113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24113","snapshot_observed_at":"2026-07-04T10:09:44.888694Z","title":"Epona: Autoregressive diffusion world model for autonomous driving","venue":null,"work_id":"7d7e7a5c-4cdf-4658-9731-f7cfe9fc6bb3","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2506.24113","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:9b45ac2d7df00b89d63cbcdf26d370806dc68ebb883525b87e1458e83ef4cbd2","observation_id":"0b2ddcb4-849e-4149-aaf6-62ce12478855","resolution":{"observed_at":"2026-05-20T07:33:07.556616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:39:36.990770Z","title":"Hieramp: Coarse-to-fine autoregressive amplification for generative dataset distillation","venue":null,"work_id":"9defdfa6-208d-4668-823c-33a34279b7fa","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:6c1a211e2541318ae19d2da832cbaf621796617476f675041638db5263d06ae5","observation_id":"a89f8daa-b429-4626-8d22-727e5ddee000","resolution":{"observed_at":"2026-05-20T07:33:07.626220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming diffusion for dataset distillation with high representativeness","venue":null,"work_id":"d563d124-8507-4c08-8fbb-c21e4e269742","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:042c13d6e599175861be625fdbdceafef5833259488a52b009aaeac6475bc5b1","observation_id":"1e7163e2-7600-4f81-a03c-ac8720f9bc56","resolution":{"observed_at":"2026-05-20T07:33:24.010056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast and memory-efficient video diffusion using streamlined inference","venue":null,"work_id":"c10d5874-45e0-499e-987d-03649e31731a","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:cefd4a54d22bfa6eb38c36c37f6d7608cb6e97fa48244cc75c9c907361e03188","observation_id":"278ab391-940f-4a33-9bd1-50592993c81e","resolution":{"observed_at":"2026-05-20T07:33:24.006406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19538","last_updated":"2026-05-13T08:29:03Z","snapshot_observed_at":"2026-08-13T16:49:04.581232Z","submitted_at":"2025-09-23T20:06:26Z","title":"DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions","version":2},"cited_work":{"arxiv_id":"2509.19538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.19538","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions","venue":"cs.LG","work_id":"bd7da4a6-6c40-4465-afb0-7a11daa99a0c","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2509.19538","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:eb276b2a557b198f5f6aa7f1455f7b63015dcd2d93589ffadb02e4142f5007ac","observation_id":"08cedce0-791c-491f-a7bd-6765f6157c5c","resolution":{"observed_at":"2026-05-20T07:33:07.527071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-15T15:02:59.826496Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:7c53f5cd1a2f260c4711e1b7e2891bd6e38c138654d8b6d7049e7e82a59be758","observation_id":"4210e69b-de55-4697-bab6-793cc986516a","resolution":{"observed_at":"2026-05-20T07:33:07.542421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-13T04:00:21.942422Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2510.02283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-08T13:14:53.231711Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","venue":"cs.CV","work_id":"3b83d5f5-6929-46ae-9de2-7c32af3c7346","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:1b994fdefd56d448913dd7ff2bb31cfa8a99ad2d31d0ea147b18c32645038005","observation_id":"4fff17bc-8e7a-47d8-a392-21834bc480ee","resolution":{"observed_at":"2026-05-20T07:33:07.551107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longcat-video technical report","venue":null,"work_id":"5f1f3d68-9cec-4387-998b-92df0114d686","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:8c047f8ee6d64e90fbf0200d7a5abb8777793b8760ea87f1d54d73149ec5366a","observation_id":"f13a3dc9-a0cc-4598-af60-67ada1d25852","resolution":{"observed_at":"2026-05-20T07:33:23.977922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":"2509.22622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-09T07:56:04.670863Z","title":"LongLive: Real-time Interactive Long Video Generation","venue":"cs.CV","work_id":"29ec6550-6ac1-4cc6-8aae-b4206f1d5b38","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:7bc4e2c2209e5292e8d1ed93f45e5107694b2ddf6a29be875de8d8bd10056334","observation_id":"c54966d6-c06a-4c14-9e8f-8c99236634af","resolution":{"observed_at":"2026-05-20T07:33:07.587053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.882376Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":"b02143c1-c2e9-4a92-ad39-93f93fd2eba7","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:71a3dc09b068ad46b37f5e547b062edd113dfeb8f5f7fb109b605ac434f81018","observation_id":"2b44d8fc-f696-42c0-8da9-ba4b92d84f1f","resolution":{"observed_at":"2026-05-20T07:33:07.581660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do generative video mod- els understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958","venue":null,"work_id":"0fdbf8f8-fd57-47c9-9134-3a322418a381","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:b55053bdc150579324aa5d2394508f24a8410c91748c4b03d4fad6d43c78867b","observation_id":"ebd4de47-58b6-4b64-895e-80c36d70732b","resolution":{"observed_at":"2026-05-20T07:33:23.975853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:5192070945498b239a1af53b74ac99f203b70aaa57c0efd1e3f143b8572e8837","observation_id":"1c47e46a-24a2-4735-bc32-eb160440f816","resolution":{"observed_at":"2026-05-20T07:33:07.584301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-16T12:51:43.372607Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:2aa22e35765d411c6d6bf921c54c77df6b094350fa0c802f8249aed3e4cc0f12","observation_id":"a98e831c-1b5f-4ca3-91d7-63573d7e2c39","resolution":{"observed_at":"2026-05-20T07:33:07.595472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20694","last_updated":"2025-02-28T03:58:23Z","snapshot_observed_at":"2026-08-16T12:54:26.116596Z","submitted_at":"2025-02-28T03:58:23Z","title":"WorldModelBench: Judging Video Generation Models As World Models","version":1},"cited_work":{"arxiv_id":"2502.20694","doi":"10.48550/arxiv.2502.20694","metadata_source":"pith","pith_arxiv_id":"2502.20694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, S., Wu, K., Zhang, C., and Zhu, Y","venue":"cs.CV","work_id":"33a5087c-1633-4d52-b891-f34d10b9e7c8","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2502.20694","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:0ef5664be35636dbbc2c81c51442b545814fcdf3d4fa491aa8c29f7ceccf2325","observation_id":"0a2e3f03-c26b-4e87-80a9-c43cf7e7d9fb","resolution":{"observed_at":"2026-05-20T07:33:07.576004Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:51.214081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:51.214081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:43.126704Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741","venue":null,"work_id":"d65a86ed-cf86-475e-9502-161e34d6a682","year":2023},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:1656234af22f9c2a83df743e048ed66545c088154b3f7cccf68229a8009bad17","observation_id":"8ca144e1-5ed4-4925-b76a-61507c2f3ad5","resolution":{"observed_at":"2026-05-20T07:33:23.977679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.687562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ad3e05b3-af3a-4fa2-ab30-c45f9f403277","year":2021},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:a8579365d3325ed0e503c48555f2f303288faf5712e70ef04e0e066450861d49","observation_id":"9a4c9848-b501-4c95-ac9b-99a6d48e60a3","resolution":{"observed_at":"2026-05-20T07:33:23.984115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:0c896d10c2b32685295fb6a38378f4e5e76c39f676a8cc0b654a05e8d90fba84","observation_id":"1590316b-66d8-4cf6-a53f-35724b89802b","resolution":{"observed_at":"2026-05-20T07:33:07.570212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting weak-to-strong consistency in semi-supervised semantic segmentation","venue":null,"work_id":"c21c01e8-626c-4334-aae2-5d4be4642bf5","year":2023},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:6842e75461206e749963fe36f5eaf6eea7ef6d763dc6ef38b6de50ae9c6a0249","observation_id":"418e5d35-e002-4b34-b98a-f936a8df6214","resolution":{"observed_at":"2026-05-20T07:33:23.974436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:376783e3b5b762dd1f2eb12802c9546cd3c52bf31a9013e5062ceb0932ed870b","observation_id":"0b22deb0-df4a-4801-b95f-74480cac1358","resolution":{"observed_at":"2026-05-20T07:33:07.567644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.537771Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"8331d9c0-b11b-4b03-89a7-e461fa541183","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:218ddca07c02791a658903d8f8210714506450d7fa263ce0cae4693804e9b9a5","observation_id":"364595ac-1e4c-4150-8781-e49882f28ef8","resolution":{"observed_at":"2026-05-20T07:33:23.972242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.778855Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":"5fbed0ab-3251-4174-88cf-edabd29a7641","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:6f4607a270643cea5244637e7ed991fc534d757ae062723a80f304439973dc2d","observation_id":"d8f82144-93c8-4830-abcc-f777dab8c6dc","resolution":{"observed_at":"2026-05-20T07:33:23.968557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffsynth-studio.https://github.com/datawhalechina/diffsynth-studio","venue":null,"work_id":"c1b8b0eb-154b-4eeb-970e-ed84dbc221ab","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:7ddecf2b0eccae3fe52777ddd93a40d520dd1be4317a598301725b3b3873ea3f","observation_id":"302fea01-1e51-455b-8828-5b43743b2392","resolution":{"observed_at":"2026-05-20T07:33:24.011679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-18T20:29:58.857701Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:616da8ceaf38ab52e83c289cccf34ad7a3cb00341d107e2e2202b3e2808a35fb","observation_id":"2749e119-40d4-4cd0-ace9-ca4057a14112","resolution":{"observed_at":"2026-05-20T07:33:07.592407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:28.009236Z","title":"Omniweaving: Towards unified video generation with free-form composition and reasoning.https://arxiv.org/abs/2603.24458","venue":null,"work_id":"c3fe3b8c-232b-435d-bf50-69ec6af6db0f","year":2026},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:4ed9e9b13754510b817b84f74a875d6edf8f662a64d47550ca566a3784d88311","observation_id":"6f0e6895-1a37-4f47-92a9-4a038a87770a","resolution":{"observed_at":"2026-05-20T07:33:07.559530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:d38085f4180dabfc82b99d3bfe6aad1f3aa99d7ae387fe85f2ed16c65ab1624a","observation_id":"d1e93c55-63b7-496a-bac3-7e435c202e64","resolution":{"observed_at":"2026-05-20T07:33:07.562468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T05:20:24.834184Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":37,"verified_fuzzy":25},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2605.19242."}