{"as_of":"2026-08-11T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd0087743b20c3d0d207cc83cca76f47bc2fec071cf497ef8491a07b4ec7513a","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:22.518133Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:21:19.012307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T18:57:31.679784Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:daeab437c484f5aee716cb989e7daf05121d3071809a65b0b7fdcb125e8a5132","observation_id":"1773a11a-af1e-4a1a-bcd0-d78ee8101786","resolution":{"observed_at":"2026-05-11T01:36:53.152030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-08-07T04:21:19.012307Z","title":"Long-context state-space video world models.arXiv preprint arXiv:2505.20171, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-09T05:08:57.326158Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.012307Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:2803c82d796d00a382046d71fe44375c4d168f0166d6a283e783ab3bb573070b","observation_id":"e1e3ebb6-ce29-4691-909f-4ef3eba43ed9","resolution":{"observed_at":"2026-08-07T04:21:19.012307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:3d63a43cb95872a5732aa3db8dd1b131abe3512200923ecad0bf99bc0d7e13de","observation_id":"9108f35e-89c0-4798-9775-7ec0528065f9","resolution":{"observed_at":"2026-05-19T05:17:06.711779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T22:36:31.044743Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2508.13009"},"observation_digest":"sha256:2ef12976aee4832050c92b9e848ea77409cd15016c5cac52a6ddf9bb1574fb17","observation_id":"3527f628-1351-4165-b6a4-9859dfeef824","resolution":{"observed_at":"2026-05-18T22:36:53.375385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-08-03T15:46:10.265242Z","title":"Long-context state-space video world models.arXiv preprint arXiv:2505.20171, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-06T15:52:47.972204Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T15:46:10.265242Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2512.15702"},"observation_digest":"sha256:26dd58ac189e1cfb04e0c93583146168ca7c3cf566ebcd5e04e59085fa1b862c","observation_id":"ca1d08b3-b425-42fa-a9f8-839af546d97e","resolution":{"observed_at":"2026-08-03T15:46:10.265242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2605.17423","last_updated":"2026-05-17T12:38:21Z","snapshot_observed_at":"2026-08-01T16:00:11.560764Z","submitted_at":"2026-05-17T12:38:21Z","title":"Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T13:15:54.413960Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2605.17423"},"observation_digest":"sha256:09d57da7390e26e9988cbb46cdccc6ea695a717da4ad84b67a63001f9eb92e8b","observation_id":"7fc7d00f-f2e5-4cdf-be23-22e04d068833","resolution":{"observed_at":"2026-05-20T13:18:18.330378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2605.18365","last_updated":"2026-05-18T13:17:08Z","snapshot_observed_at":"2026-08-02T07:31:08.555715Z","submitted_at":"2026-05-18T13:17:08Z","title":"GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:09.367559Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2605.18365"},"observation_digest":"sha256:78a4e03129821fda2b310aa365e7274ec0a776854b85cdc6c3a890c2f6fa1977","observation_id":"339c9c00-4d60-49ab-9ac4-417224d0d756","resolution":{"observed_at":"2026-05-20T11:08:13.663975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2606.00133","last_updated":"2026-05-28T21:23:24Z","snapshot_observed_at":"2026-08-08T14:09:01.838142Z","submitted_at":"2026-05-28T21:23:24Z","title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","version":1},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:23.776293Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2606.00133"},"observation_digest":"sha256:d29aa54db6558cbceb9ed8852e87cf27c1137b30cde4f5ccf5dbf3fad728a8fd","observation_id":"2e007854-4e2f-4b2f-bf2c-91a5db6d3f41","resolution":{"observed_at":"2026-06-29T08:43:15.753547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:c055f4e850cae52bf4906e20af7d5b4d15a5a1366cb405ce1c55668478155c34","observation_id":"0f336968-a046-4857-9dd6-f4e569695d36","resolution":{"observed_at":"2026-07-03T00:57:29.774285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2606.27677","last_updated":"2026-07-12T12:46:30Z","snapshot_observed_at":"2026-08-02T12:54:53.370122Z","submitted_at":"2026-06-26T03:17:39Z","title":"DIM-WAM: World-Action Modeling with Diverse Historical Event Memory","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T04:58:47.490871Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2606.27677"},"observation_digest":"sha256:ed19b0bd94a5ed23f60cf3a9caa09a8e390dd68c924bab96c149ceb6e02fa230","observation_id":"8e6e4ec2-3108-4eb0-859a-025bfb648964","resolution":{"observed_at":"2026-06-29T19:03:51.997356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-14T17:14:54.438474Z","title":"Long context state space video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27677","last_updated":"2026-07-12T12:46:30Z","snapshot_observed_at":"2026-08-02T12:54:53.370122Z","submitted_at":"2026-06-26T03:17:39Z","title":"DIM-WAM: World-Action Modeling with Diverse Historical Event Memory","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:54.438474Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2606.27677"},"observation_digest":"sha256:5358b4abb8ba5c255b16632640a4573c8f18b89b8b6fd2d241b9d335d486d638","observation_id":"6155cf46-a12b-47ed-9401-d555d081b73f","resolution":{"observed_at":"2026-07-14T17:14:54.438474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-08-07T09:44:34.339704Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:079aab162073a3226ae98691963e3ed5f47c97e275a97670dbd71806c3718396","observation_id":"aa774030-1094-409a-b8ea-c2344f10c2e0","resolution":{"observed_at":"2026-07-01T10:25:41.872252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":"2505.20171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-07-10T18:57:31.679784Z","title":"Long-context state-space video world models.ArXiv, abs/2505.20171","venue":"cs.CV","work_id":"c35e6872-01ea-417a-ba0f-442c82e051c5","year":2025},"citing_paper":{"arxiv_id":"2607.07763","last_updated":"2026-07-08T15:31:53Z","snapshot_observed_at":"2026-08-02T03:29:36.935887Z","submitted_at":"2026-07-08T15:31:53Z","title":"Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T18:48:29.572602Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2607.07763"},"observation_digest":"sha256:c2b03003e6cfeb4d66e8394823f019b33b3aa1c9fe0c835ec4ca447673904aec","observation_id":"a6773206-7a53-4f72-b052-7e934bd17cf1","resolution":{"observed_at":"2026-07-10T18:57:31.681222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20171/citation-record","integrity":"/paper/2505.20171/integrity","json":"/paper/2505.20171/citation-record.json","paper":"/paper/2505.20171"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:13.094213Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.094213Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:89781a41c8aae1b0b5e531204b3afa06bb665be2103996c4ae3c6fa3bda29132","observation_id":"a7731cbc-afd5-4954-88d4-7e645be1f82c","resolution":{"observed_at":"2026-08-07T14:03:13.094213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:13.168532Z","title":"Genesis: A universal and generative physics engine for robotics and beyond, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.168532Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:2d26293e15ba311e60d284252ba2e15700a063db888339668d26ab9b71c55405","observation_id":"964254a6-692d-4b64-af2a-653b8704fe62","resolution":{"observed_at":"2026-08-07T14:03:13.168532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T14:03:13.313590Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.313590Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:757ee0506c2e420f36a3fd9c7289119ca666bf1db0359d394c69f60fe88bfe50","observation_id":"67468d09-0eca-4a29-9800-9db4a679f8d3","resolution":{"observed_at":"2026-08-07T14:03:13.313590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-07T09:00:33.558814Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-07T14:03:13.404098Z","title":"Ti- tans: Learning to memorize at test time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.404098Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:4f6f911a5be15e8a88d0c808c15de9d54b366f02799e512c4cc501dc60dc5df8","observation_id":"847d4f8f-7ad3-4600-bcfa-9a0d6680fb12","resolution":{"observed_at":"2026-08-07T14:03:13.404098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:13.550996Z","title":"Decimamba: Exploring the length extrapolation potential of mamba","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.550996Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:810bcafa17929f82990169f1e68e17696cc8b39742b641942cad011a2aa35d68","observation_id":"2736a171-0c7e-42d5-85d6-72382f192ac1","resolution":{"observed_at":"2026-08-07T14:03:13.550996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:03:13.707554Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.707554Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:a9d83af630fd9c3af4fec59ad2ffbc428b269984cfa00b45be8dbe8ddbd27317","observation_id":"8277f684-58eb-43e6-b379-5c07c7dac116","resolution":{"observed_at":"2026-08-07T14:03:13.707554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:13.815096Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.815096Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:03a02bcde7f351f0e5f7dae0b88501bd163badb386d5e031f8e16a5e7e9e61d9","observation_id":"48263f9d-3019-4c5f-823e-9e9d6cfe6075","resolution":{"observed_at":"2026-08-07T14:03:13.815096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15391","last_updated":"2024-02-23T15:47:26Z","snapshot_observed_at":"2026-08-03T22:04:23.465893Z","submitted_at":"2024-02-23T15:47:26Z","title":"Genie: Generative Interactive Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15391","snapshot_observed_at":"2026-08-07T14:03:13.943294Z","title":"Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.943294Z"},"links":{"cited_paper":"/paper/2402.15391","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:85d8fad6529344088e97b2819b8ddfd951a5649638d3bf0ac2a241e75f3f5cef","observation_id":"85323cea-7cd7-47e4-99fc-48aa6feff974","resolution":{"observed_at":"2026-08-07T14:03:13.943294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:14.045968Z","title":"Gamegen-x: Interactive open-world game video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.045968Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:ac6778230b505e73a177517a2526115c58f34cd44d78be335e6b0c1e032f0b82","observation_id":"519da0a0-627a-45d0-ac38-4110a4b10ce7","resolution":{"observed_at":"2026-08-07T14:03:14.045968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:14.137224Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffu- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.137224Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:f319b3495c537fc3f428f4b83fabe0dc7642ddf8aa8f48f224306b910962871b","observation_id":"a350047b-1105-4e18-9795-78ae5e989a81","resolution":{"observed_at":"2026-08-07T14:03:14.137224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:14.267801Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.267801Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:77c6e3757c6186bf8de254d3cdfaa118a821e9a32df28ba1853b6e42d25f55c8","observation_id":"b3d4e12c-c445-4b8a-8230-d2d6fe1d5ced","resolution":{"observed_at":"2026-08-07T14:03:14.267801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:14.415179Z","title":"Recurrent environment simulators","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.415179Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:e891665ff2010b1427a502c995f97621ef8da1764e1f80dfe8257864362717ef","observation_id":"de8fa916-6d46-495e-8cd4-5c6bb12b91f5","resolution":{"observed_at":"2026-08-07T14:03:14.415179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:14.542983Z","title":"Transformers are ssms: General- ized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.542983Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:30e130af2a9f0ad05bfbb46519880c01ad9c065f283bfcc8700316ffc29623c1","observation_id":"ca41c59e-5d74-4159-9afc-93e34c6a85f3","resolution":{"observed_at":"2026-08-07T14:03:14.542983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:14.660059Z","title":"Oasis: A universe in a transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.660059Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:17f741cef81f829e4f6e9566efbff9411fc66bbe6f9acec1ac98cb6da17faeaa","observation_id":"f3eaf4ae-9589-4be9-b561-8cddf27d34b3","resolution":{"observed_at":"2026-08-07T14:03:14.660059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-07T15:28:16.662668Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05496","snapshot_observed_at":"2026-08-07T14:03:14.818750Z","title":"Flex attention: A programming model for generating optimized attention kernels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.818750Z"},"links":{"cited_paper":"/paper/2412.05496","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:6a4d70d10a5726b60938602de18e6866b7e79f394f9fc6c9e6bf8d1dd7c267ca","observation_id":"222eed6a-2ac6-40aa-af1f-19e17cf49001","resolution":{"observed_at":"2026-08-07T14:03:14.818750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-08-07T13:35:51.338673Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03568","snapshot_observed_at":"2026-08-07T14:03:14.888852Z","title":"The matrix: Infinite-horizon world generation with real-time moving control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.888852Z"},"links":{"cited_paper":"/paper/2412.03568","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:1f4635e57fb010ebe51e3e65971c01a0e3d9b90a0d106549438b0e9dacb76a98","observation_id":"a9deea28-4b67-434e-99ca-58a08032f7ab","resolution":{"observed_at":"2026-08-07T14:03:14.888852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10981","last_updated":"2024-06-16T15:37:22Z","snapshot_observed_at":"2026-07-06T18:31:45.125236Z","submitted_at":"2024-06-16T15:37:22Z","title":"ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10981","snapshot_observed_at":"2026-08-07T14:03:14.996741Z","title":"Vid-gpt: Introducing gpt-style autoregres- sive generation in video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:14.996741Z"},"links":{"cited_paper":"/paper/2406.10981","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:752c7bc332e91e7c1aa79a488afde7eb7e1894d63d674697e94e852a2c1bd2d9","observation_id":"a96975dc-4aeb-444e-9db7-10a4edf6f0c6","resolution":{"observed_at":"2026-08-07T14:03:14.996741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16375","last_updated":"2025-05-21T10:38:01Z","snapshot_observed_at":"2026-08-10T13:12:38.948884Z","submitted_at":"2024-11-25T13:33:41Z","title":"Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16375","snapshot_observed_at":"2026-08-07T14:03:15.086030Z","title":"Ca2-vdm: Efficient autoregres- sive video diffusion model with causal generation and cache sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.086030Z"},"links":{"cited_paper":"/paper/2411.16375","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:ae314362345a665d588dc97fcabf42058501356d8558a4a211817e04d92ed616","observation_id":"f233286d-4875-406a-85c5-81bd97b25165","resolution":{"observed_at":"2026-08-07T14:03:15.086030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03025","last_updated":"2024-05-10T08:30:07Z","snapshot_observed_at":"2026-08-06T17:14:58.934575Z","submitted_at":"2024-05-05T18:36:45Z","title":"Matten: Video Generation with Mamba-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03025","snapshot_observed_at":"2026-08-07T14:03:15.220599Z","title":"Matten: Video generation with mamba- attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.220599Z"},"links":{"cited_paper":"/paper/2405.03025","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7241a16705beb004a23f7d3e48b7dfcb51937bb56b1404a6a3d53643baf37415","observation_id":"875935de-12fb-40c6-b4f8-4ab3ed0569ff","resolution":{"observed_at":"2026-08-07T14:03:15.220599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:30.739763Z","title":"Mamba: Linear-time sequence mod- eling with selective state spaces","venue":null,"work_id":"4f8765fd-dbf3-4289-a32d-e65ce7a33df3","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.307349Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7d0def4bbe9bb001d5f8df5be4482bc88253ab939dc8a9c15718d89e60612e9f","observation_id":"96119e04-a918-49d7-a56e-1d141d6b69aa","resolution":{"observed_at":"2026-08-07T14:03:30.837639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:30.520183Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"c6b35e5b-95d3-44b3-97e4-3aa005bffd5a","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.432865Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:f324693b4b00195ebb15381052225a382b49b800fe825d61d6b40b507a1062ad","observation_id":"f8fa790d-0392-4330-a37d-2fc7dd3c6305","resolution":{"observed_at":"2026-08-07T14:03:30.604414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:30.361848Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":"37d2d0c1-712d-41f1-b2a8-1def7761eb36","year":2018},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.585664Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:f13b3c97d91b7fa7c008c1828593760387ae41ee1e2d435eaaf1692534f656f5","observation_id":"d075f22b-89c3-495d-a897-72d82bd78abe","resolution":{"observed_at":"2026-08-07T14:03:30.404915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-07T14:03:15.718498Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.718498Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:fb5c3911f039a514f6281e3e1e4b21b77269ff995be80886d736d7b5aed79a0a","observation_id":"4be1f272-8c97-481d-be4f-a252e66f65c0","resolution":{"observed_at":"2026-08-07T14:03:15.718498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:30.155054Z","title":"Dream to control: Learning behaviors by la- tent imagination","venue":null,"work_id":"fb2168e6-a71e-4f32-9218-087dfc9e3e9a","year":2020},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.840486Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:c107dac6ee4508362caecbcd731011c70cda117a3216ba92f98b3af448fa2da4","observation_id":"7b58a9b2-aa47-426b-9938-186a6051324f","resolution":{"observed_at":"2026-08-07T14:03:30.282631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-09T01:46:25.522034Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07825","snapshot_observed_at":"2026-08-07T14:03:15.907426Z","title":"Pre-trained video generative models as world simula- tors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:15.907426Z"},"links":{"cited_paper":"/paper/2502.07825","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:2bd3caef9face83bc48eb5f210fe3b70b10f591475f324879db6b3cebe1b5209","observation_id":"8b281877-bc57-4655-8c14-5222c3132691","resolution":{"observed_at":"2026-08-07T14:03:15.907426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-10T00:51:42.114461Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-07T14:03:16.018949Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.018949Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:cdb0fc63145669eca22276f30d719380d8782e4b7282752c215edd6db2f5d0a4","observation_id":"2c3da88d-ba8f-4910-8aaa-847a5e295e7a","resolution":{"observed_at":"2026-08-07T14:03:16.018949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:16.160163Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.160163Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:5409acf67f4484bd313525e9defee86fe55fa58f3818509b44f0ae661fef7726","observation_id":"a2b1bd05-859e-484f-8c0c-93152b1f8eb3","resolution":{"observed_at":"2026-08-07T14:03:16.160163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:29.954950Z","title":"Video dif- fusion models","venue":null,"work_id":"d2cda1d2-8069-4fe9-bee4-f55d0916e981","year":2022},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.257764Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:fdf72b4d2c1e653eafa8c9d58f9ba00b74698e74d9f9ddf3cd7c34ab0557a2f4","observation_id":"989b68a3-13a7-4e59-af0a-29aea668730c","resolution":{"observed_at":"2026-08-07T14:03:30.023389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:16.331725Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.331725Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:b94fb5a1841827d1befe2640d112e13bfaeffcf40a249215ca763e6f4fec3a05","observation_id":"7df3940e-ad96-4b7c-a8b5-06f557d3cd42","resolution":{"observed_at":"2026-08-07T14:03:16.331725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-07T14:03:16.416898Z","title":"Gaia-1: A generative world model for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.416898Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:a1151d94630ec620a9c313705e45ab001286c8c9d0476fa4def345db3b63210e","observation_id":"229207fc-d208-4c04-ba2e-1ba4117056e1","resolution":{"observed_at":"2026-08-07T14:03:16.416898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:16.537343Z","title":"Acdit: Interpolating autoregressive con- ditional modeling and diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.537343Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:ad2b599cd74f23f4788dfce4ffcf2033deaa0ef8d690ddd86b21f480813dfe3d","observation_id":"2ae7b6de-e6c6-4b77-bcfe-4164906c15f5","resolution":{"observed_at":"2026-08-07T14:03:16.537343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:16.645420Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.645420Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:04ceaa5b457d19a549fc4061d59ebb44559604f856c746a2cf3460802baeab20","observation_id":"aa26676e-58fe-4c3e-be36-3fe70df56d99","resolution":{"observed_at":"2026-08-07T14:03:16.645420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:29.659118Z","title":"Multimodal unsupervised image-to-image translation","venue":null,"work_id":"e9787252-a925-49ac-a5d9-73ff80109161","year":2018},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.762878Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:46998e42d31fe87559ced92685603a56523ec7d099dcaf0b5053f68c3c9828c3","observation_id":"4947d86f-3e5b-4ba3-8889-75aab7fd5cfd","resolution":{"observed_at":"2026-08-07T14:03:29.755571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:29.373630Z","title":"Scope of va- lidity of psnr in image/video quality assessment","venue":null,"work_id":"5729ccfb-3063-46c1-85f9-cecb2bd621c1","year":2008},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:16.894699Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:26cf736281f58ad18aa23c3c46a708a1eb0c6653e5eb930623a55690cbe9bc24","observation_id":"2e0614a8-c3b6-40ee-ad27-1ebfe8867088","resolution":{"observed_at":"2026-08-07T14:03:29.514119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:29.143407Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":"ffbc5bcc-771a-4437-a32d-8049de9fa138","year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.006540Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:cff3e585307d8a626f65af642eddd594880fb07fb659e60fc2bfe6b103d32317","observation_id":"4920de98-84a5-498f-b4d9-fb662e427f41","resolution":{"observed_at":"2026-08-07T14:03:29.237917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-07T14:03:17.134702Z","title":"How far is video generation from world model: A physical law perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.134702Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:f38d7f177349a9e98b38e502d5efa71a5c2eec541c6b6528f4cbff2cee65b77b","observation_id":"7ef85091-9189-43fe-a68d-28b5f17ec309","resolution":{"observed_at":"2026-08-07T14:03:17.134702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:28.849696Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"41b839be-2299-4f55-a4d9-b531405f5da3","year":2020},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.240504Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:f60aa3906d68e5bdbbfeb4749b62c7865aec0824e3a580159701cbec7211d6f2","observation_id":"e2b2dbc1-d9bf-43f3-86c4-5755133f6c0b","resolution":{"observed_at":"2026-08-07T14:03:28.960909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:28.694409Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":"b853e1b0-891e-4672-ad19-2fe003fdc707","year":2014},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.335865Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:ce902cef014c5b3ed9fca17cee0225e68bc09916369268e4d98c7b7ee6a2e729","observation_id":"54e1da3c-4805-491e-bd9d-60b3d74d0afb","resolution":{"observed_at":"2026-08-07T14:03:28.756823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:28.521608Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":"7cb1a758-9280-4719-910e-daaf04f8ce9c","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.413062Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:8e0019590be6493581e4e4896e69b5656afac7e671247f82a2e9716c2b755e7d","observation_id":"5a3342d7-0d96-4021-8606-0150a1f12cfa","resolution":{"observed_at":"2026-08-07T14:03:28.607509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T14:03:17.521847Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.521847Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:45e6c9c2c4367c9c044b78772df456b2712a0a0c441f67ecb0647280426a64c4","observation_id":"d825f69f-92f4-48fd-9e3a-b70b20aab223","resolution":{"observed_at":"2026-08-07T14:03:17.521847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:28.247111Z","title":"Efficient spatially sparse inference for conditional gans and diffusion models","venue":null,"work_id":"fbc8bbeb-717b-40d1-8952-cce7c0bc01bb","year":2022},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.605903Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:26b16ff12fa1347df6afaec807dcde5bff935a418494afd8ad067b577b94793b","observation_id":"30acb6ad-bad2-4a6a-b9bb-f2209ae2aece","resolution":{"observed_at":"2026-08-07T14:03:28.379381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16112","last_updated":"2024-12-20T17:57:09Z","snapshot_observed_at":"2026-08-11T00:19:41.166848Z","submitted_at":"2024-12-20T17:57:09Z","title":"CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16112","snapshot_observed_at":"2026-08-07T14:03:17.722525Z","title":"Clear: Conv-like linearization revs pre-trained diffusion transform- ers up","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.722525Z"},"links":{"cited_paper":"/paper/2412.16112","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:226155ccce5d5fbc79b534cbb22bd3449252062dfcf18109efbb02e0516fb12d","observation_id":"78d5b7f4-987c-41d8-8fff-0866a7dab333","resolution":{"observed_at":"2026-08-07T14:03:17.722525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02097","last_updated":"2024-10-17T08:09:37Z","snapshot_observed_at":"2026-08-09T17:41:45.360146Z","submitted_at":"2024-09-03T17:54:39Z","title":"LinFusion: 1 GPU, 1 Minute, 16K Image","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02097","snapshot_observed_at":"2026-08-07T14:03:17.907050Z","title":"Linfusion: 1 gpu, 1 minute, 16k image.arXiv preprint arXiv:2409.02097, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.907050Z"},"links":{"cited_paper":"/paper/2409.02097","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:e2f275f54a2047a51b2d41bcaa28068d4cfe784eea7340c0e3e8326925d25d11","observation_id":"07f81108-c6cd-481c-b297-ffa44504f9ba","resolution":{"observed_at":"2026-08-07T14:03:17.907050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T14:03:17.999337Z","title":"Step-video-t2v technical re- port: The practice, challenges, and future of video founda- tion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:17.999337Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:ba6eecfbb8113b03a0de7b1d20df2920be09bb4655b219d19d7f262ba3bcee73","observation_id":"8f078112-24ed-433d-a8ce-16f4e032b360","resolution":{"observed_at":"2026-08-07T14:03:17.999337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:28.065332Z","title":"Playable video gen- eration","venue":null,"work_id":"5fe26501-8f9a-4003-85bf-51108c034d7b","year":2021},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.065670Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:d0a134004bd508e7b9cc99c3b137b660d9120c076d37b628c224263a09dd9fb9","observation_id":"0db3d003-c977-4794-9ebb-df6f95fba207","resolution":{"observed_at":"2026-08-07T14:03:28.111106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:27.967151Z","title":"Trans- formers are sample-efficient world models","venue":null,"work_id":"72096d93-0cf5-4d6d-a165-52831ce032e1","year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.241996Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:6956ab8f3241d5268a15e6752a614f15995b6446b65e61aaf2e053e5f083a807","observation_id":"c4a193a0-a258-4691-a098-6bc60be42ac3","resolution":{"observed_at":"2026-08-07T14:03:28.015404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:27.838815Z","title":"Action-conditional video prediction us- ing deep networks in atari games","venue":null,"work_id":"eb3a6b85-8a85-4823-be74-10c8ddeb7367","year":2015},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.342889Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:a40a29c12f6d3bc309b2cfcd0259de28b4235750f6f99867bd99a9c5aa640728","observation_id":"e7b5ca6c-05c2-4c64-945f-8f941d9f1212","resolution":{"observed_at":"2026-08-07T14:03:27.913432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07711","last_updated":"2026-06-27T16:03:47Z","snapshot_observed_at":"2026-07-06T17:43:22.965126Z","submitted_at":"2024-03-12T14:53:56Z","title":"SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07711","snapshot_observed_at":"2026-08-07T14:03:18.416980Z","title":"Ssm meets video diffusion models: Efficient long-term video generation with structured state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.416980Z"},"links":{"cited_paper":"/paper/2403.07711","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7599dfb5ac4dc1b50b7185c3e469c24baae39ac9d6de5148065256c8088d0042","observation_id":"5e85fd6a-5274-429e-a918-0f5d03f88d01","resolution":{"observed_at":"2026-08-07T14:03:18.416980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:27.678933Z","title":"Genie 2: A large-scale foundation world model","venue":null,"work_id":"b6ee029d-df8b-45ae-b2ce-b75db1c59773","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.534361Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:dd092e811aaa3b00d9760fe6767c7b64fa592aefb5c7f1de77e19a54ac7b0c39","observation_id":"652b46b9-da39-4458-a83b-e268701808e8","resolution":{"observed_at":"2026-08-07T14:03:27.755835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13383","last_updated":"2022-10-24T16:32:28Z","snapshot_observed_at":"2026-08-10T06:24:06.318552Z","submitted_at":"2022-10-24T16:32:28Z","title":"Evaluating Long-Term Memory in 3D Mazes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13383","snapshot_observed_at":"2026-08-07T14:03:18.640529Z","title":"Evaluating long-term memory in 3d mazes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.640529Z"},"links":{"cited_paper":"/paper/2210.13383","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:071dea122771110f2dcf71bbbfc7ab4a039171354834ad9fa03f022b2b607f88","observation_id":"bdf3bfc0-fa1a-46ac-bf56-0277d90acc8d","resolution":{"observed_at":"2026-08-07T14:03:18.640529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:27.423038Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"930a7b67-3ddc-4312-9c95-cd2247c602d8","year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.726109Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7310ed5193586bf2a5f1bd0fac415a343bf8f0584592d9e068cdce5993f91b5d","observation_id":"6ce10524-94fa-4064-a773-99840c330eec","resolution":{"observed_at":"2026-08-07T14:03:27.540600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T14:03:18.814503Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.814503Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:176fa687c7500f76715c0d48aa5878152259d513fb14b9b822ddac640c60f991","observation_id":"52a3b87a-82de-4dc9-84ff-ed35d2ef92f3","resolution":{"observed_at":"2026-08-07T14:03:18.814503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:03:18.919699Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.919699Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:0ce92e69cae7e3ebc95cc60e4703c3f3f5a59c652733abe9c1d8ef116256722f","observation_id":"8a254fc4-8ee8-4ec4-9b55-a4f97642db41","resolution":{"observed_at":"2026-08-07T14:03:18.919699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-06T19:04:16.718797Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-07T14:03:19.068672Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.068672Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:e83265337c3a0e761b12f8c074edf55828b76d6cfcffa78bf31d1eccc980a65a","observation_id":"18fd7d6d-d3fd-413a-840d-280a2be88e76","resolution":{"observed_at":"2026-08-07T14:03:19.068672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:19.141580Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.141580Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:35374b47a4052ca00201caf0a11dd87b76f58e45795eae5c6edcf760dc6b9429","observation_id":"c8c3a4a9-1ccb-4dcb-a202-43f934d3c21e","resolution":{"observed_at":"2026-08-07T14:03:19.141580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:19.248197Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.248197Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:6776f38698d30469e5eae8e4e592c4fb2cf30994fa3cdfde10a0f36a013c6353","observation_id":"c3122658-0588-4170-81dc-8a1cc94d59be","resolution":{"observed_at":"2026-08-07T14:03:19.248197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:27.121164Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"d327aece-68bc-445e-916d-13976841de2d","year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.357819Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:4a8643c660ab3f349d0e5dcf41e4fff0c37ff760470ae2bb1ecaad9ab3736328","observation_id":"17bb820e-575e-48fa-8378-cc3b6e1f0a1c","resolution":{"observed_at":"2026-08-07T14:03:27.223712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:19.439809Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.439809Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:13fafba0ea33044bb9c4f83e1387b1a63c94d5b2cf38cfa6d111c87b80fe1c82","observation_id":"f119f5f5-fe32-41c8-b5b0-ab2101192b55","resolution":{"observed_at":"2026-08-07T14:03:19.439809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-07T11:01:49.684719Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-07T14:03:19.511480Z","title":"History-guided video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.511480Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:246972f4760937b64696e3a39150b79613417fa962d5328e179b6533ffbae006","observation_id":"b458a00d-8161-4a70-9e19-c6e5044fe715","resolution":{"observed_at":"2026-08-07T14:03:19.511480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:19.619752Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.619752Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7212dd60f797ec10a67dad29f4378cd934ca9a437f4c5ab3f509537e4bdc3ce9","observation_id":"5053d318-0ec0-4cde-b52e-5c080c08c12b","resolution":{"observed_at":"2026-08-07T14:03:19.619752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:26.865117Z","title":"Me playing a few minutes of ai minecraft","venue":null,"work_id":"67d7dd51-e57a-46bf-9985-07b8fdb0862a","year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.726882Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:965aeacc1e0cbb47b53bebe84dafe183fd844ae69a5c0f77a7b8e0124d44eea5","observation_id":"4ce5bba6-1ad2-4c11-ba80-3c233cd72ce5","resolution":{"observed_at":"2026-08-07T14:03:26.952215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:03:19.858698Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.858698Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:2c6b8602016aa3c42f2a5521acaebc2124342354d85c3c2e83bd106b74c214c2","observation_id":"d07da5bd-7601-433b-993f-05070d5f1fe8","resolution":{"observed_at":"2026-08-07T14:03:19.858698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-07T14:03:19.946773Z","title":"Learning to (learn at test time): Rnns with expressive hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:19.946773Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:5b93471baed0bdd3bdb0a98df1f6a053413561af33913edcc01485d19ac0081d","observation_id":"70d73b0f-5669-4fb1-ac8c-e3dada902d9c","resolution":{"observed_at":"2026-08-07T14:03:19.946773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14224","last_updated":"2024-07-10T09:02:11Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T06:53:18Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14224","snapshot_observed_at":"2026-08-07T14:03:20.027371Z","title":"Dim: Diffusion mamba for efficient high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.027371Z"},"links":{"cited_paper":"/paper/2405.14224","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:19ae5000c852c9a4baf23a00bd74d8ceccc66241824d5cb849c80b715d62e62c","observation_id":"e6424556-1131-4bd9-a5d7-be9a11f3d745","resolution":{"observed_at":"2026-08-07T14:03:20.027371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T14:03:20.157040Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.157040Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:c2ef38534b110eb776c906391f29735171b676b5940a8a4da447fbb064105d55","observation_id":"9312dbd3-da2f-4a60-b2a0-2764361bf3d3","resolution":{"observed_at":"2026-08-07T14:03:20.157040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:20.254830Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.254830Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:32986a5eb7507d85810b101679d260b6629262979bd819a4c5dd03f1b5c9a5d8","observation_id":"e28f9ca7-2a03-4b96-8781-7015805f778c","resolution":{"observed_at":"2026-08-07T14:03:20.254830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:26.644671Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"ad817249-8e93-45ba-8e44-3908758e7f6e","year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.366337Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7ebe3399d6048acdbd986020bbdbc48a31859934c56ffeab3777c49546082857","observation_id":"41ee4b61-a540-401a-8fc6-08320cdc7712","resolution":{"observed_at":"2026-08-07T14:03:26.737810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-11T04:36:45.520517Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T14:03:20.460990Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computa- tional complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.460990Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:69a2799c61ad9d87133d85e0fa9290ae913c04038d38d0e99a55fed6f55321d6","observation_id":"0b237622-2fa2-45f5-8386-99bd91f8cf11","resolution":{"observed_at":"2026-08-07T14:03:20.460990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-07T06:47:36.460071Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-07T14:03:20.562826Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked to- kens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.562826Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:4be15d8f94ae986d0989459dec5f4c39fe28d597123684d64fc552c3548fad66","observation_id":"909be15d-779c-4c8f-9a89-a3e915be256c","resolution":{"observed_at":"2026-08-07T14:03:20.562826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-08T15:15:02.406405Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-07T14:03:20.688743Z","title":"Loong: Generating minute-level long videos with autoregressive lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.688743Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:17545bfc9480b49832f32f3459c3cbec0bb49322b357a912ccf643f2f4f5431b","observation_id":"234ef67b-9fed-4f69-b73b-0b10d0e4e238","resolution":{"observed_at":"2026-08-07T14:03:20.688743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:26.421857Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"09de4205-d8de-4e76-b270-8d5a717257f7","year":2004},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.771057Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:c820e590d112235898d74ffa7163f6d28ded1b5ad449d2d164b47a8f446c692d","observation_id":"1388b870-4fd4-46a3-a927-bd729ff9cf2e","resolution":{"observed_at":"2026-08-07T14:03:26.533148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:26.211130Z","title":"Art-v: Auto-regressive text-to- video generation with diffusion models","venue":null,"work_id":"07a9cd65-dd24-4f2a-8b39-eb8bf2078529","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.839420Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:f89f8379dc97534107dbefde52d6145e1d4d9c346039a4693dc602ed57e1c7ac","observation_id":"11c6c57c-bfa3-4e60-9e71-1e81bb80c769","resolution":{"observed_at":"2026-08-07T14:03:26.300393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:26.045179Z","title":"Daydreamer: World models for physical robot learning","venue":null,"work_id":"0f5548c3-3295-4c37-9136-9b050532d988","year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.900150Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:0bac741beb792524967e9e4608e01c989b49db5758ce0899f3c2dd50158ac3c2","observation_id":"309a7e9d-e34a-4216-a77b-643760c35dbd","resolution":{"observed_at":"2026-08-07T14:03:26.119563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-08T08:58:45.984697Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T14:03:20.983153Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.983153Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:608fba6549e7343893816b7bc8117fa928f4d125194055bc49eef7e86bf8cc33","observation_id":"aa128de2-289c-4198-b136-a9ef32aed6f5","resolution":{"observed_at":"2026-08-07T14:03:20.983153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T14:03:21.075820Z","title":"Sana: Efficient high-resolution image syn- thesis with linear diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.075820Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:89bf8325e06447531c75e587484c0e784cd4f28db6ffa2a0c9a20d98f676b705","observation_id":"7304587a-a298-4ce8-ae4a-3ee3e664744f","resolution":{"observed_at":"2026-08-07T14:03:21.075820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:25.877624Z","title":"Diffu- sion models without attention","venue":null,"work_id":"502363ef-ac1e-4b91-8c99-6565bd0d7544","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.192966Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:43a7069337e2534ea869c3246fa54e4ab2c9c1767ff75dcd2da6e6ab911f4236","observation_id":"388b8e3c-c83f-4e93-9827-0de7c9324025","resolution":{"observed_at":"2026-08-07T14:03:25.917127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-07T14:03:21.272106Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.272106Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:735fab652f432d6c1d16e61774c9c5c0b7338483e28623ebd89f0761d0aeefa1","observation_id":"6d0575d1-3475-47b8-a4cb-7a7af02e807a","resolution":{"observed_at":"2026-08-07T14:03:21.272106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:25.690503Z","title":null,"venue":null,"work_id":"4a139506-d35f-4f60-9215-ff82579a4b92","year":2022},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.364568Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:93d7f022e882be677c8b345207cd1b600847241a3e4bfcaf564b970a841087eb","observation_id":"7a665ead-fc74-4896-a9c8-b819fc1adb39","resolution":{"observed_at":"2026-08-07T14:03:25.757592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T14:03:21.470654Z","title":"Learn- ing interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.470654Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:04af363922f3ebf663e26abf798775a0bc5610a443a5295873c5a9feae177556","observation_id":"7e21047d-a472-4e77-ac10-d86132592f56","resolution":{"observed_at":"2026-08-07T14:03:21.470654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T14:03:21.536208Z","title":"Gated linear attention trans- formers with hardware-efficient training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.536208Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:759fd8cda2b93b7da251e8b765e2c84a701e7e18dae3a6366102f3e0ace30c72","observation_id":"56b7215f-d2ce-4be3-8b47-9003c2e669bb","resolution":{"observed_at":"2026-08-07T14:03:21.536208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-07T14:03:21.630393Z","title":"Gated delta networks: Improving mamba2 with delta rule.arXiv preprint arXiv:2412.06464, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.630393Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:821bdcdb8db2fcd0282b83705d76467e700f4888d073249487443f4f291cf267","observation_id":"740bc463-2b72-4d8b-85fd-3318b8d55a5b","resolution":{"observed_at":"2026-08-07T14:03:21.630393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:25.480894Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"d57ba7b7-90c8-412c-8390-ca24e97d99d7","year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.734094Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:a77c3c39b3b89483a1a500657dc3e07a477849bbe274592172e74052d650b14a","observation_id":"d7ec5cd7-723c-45c3-a4c9-b42de1df83c1","resolution":{"observed_at":"2026-08-07T14:03:25.603899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T14:03:21.815035Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.815035Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:44e90cfc380f9a981ada098092ba0536c749b8a48593eb1be911c44f24f1f4d3","observation_id":"6f2480ad-fac2-4c7b-a1eb-186157e1c190","resolution":{"observed_at":"2026-08-07T14:03:21.815035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:25.267338Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"2307c363-6ecc-4faa-8023-7ca17686fd46","year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:21.918729Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:361d811b124ce8371d32b758666337c56282876f61e8b07716cecfedd5c90a72","observation_id":"bf691532-5f12-4e48-8d8c-b90cb104d130","resolution":{"observed_at":"2026-08-07T14:03:25.382778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:25.111305Z","title":"Longmamba: Enhancing mamba’s long-context capabilities via training-free receptive field en- largement","venue":null,"work_id":"b3978884-39ec-4abe-ac00-5f8cd33da8e2","year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:22.027914Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:7876a6f34c540d965f83ec6aefdbcccd63fb8b2cd2468c56712d1810259cc6d2","observation_id":"91970bd0-59f5-4365-8dd8-ba581a3249c4","resolution":{"observed_at":"2026-08-07T14:03:25.164508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:24.947547Z","title":"From slow bidirectional to fast autoregressive video diffusion mod- els","venue":null,"work_id":"4df415ca-f779-4b6d-899b-aa253104e917","year":2025},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:22.125610Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:c956eeed1f60fc394857a0640f6cb67f1b166d8ddd8e881540a98c23c53e46ea","observation_id":"6c7818fc-e661-48f3-b569-e971e4c66ad1","resolution":{"observed_at":"2026-08-07T14:03:25.013960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:22.227097Z","title":"Gamefactory: Creating new games with gen- erative interactive videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:22.227097Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:af92b317f5592ea60ac9b4ab40dc13dae0eedf2723eceb33fb137f52b971d858","observation_id":"ca417230-ed20-4d09-b209-d797aa74d254","resolution":{"observed_at":"2026-08-07T14:03:22.227097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:22.353236Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:22.353236Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:e818ed218d005f438988ce6635d951f2785be9cfde8ee641ce656edb1daa35aa","observation_id":"b74f5836-1642-4e11-9722-30fdf273a8d8","resolution":{"observed_at":"2026-08-07T14:03:22.353236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:24.696934Z","title":"Extdm: Distribution extrapolation diffu- sion model for video prediction","venue":null,"work_id":"64c03a11-a301-4e67-a432-6b403c0292d7","year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:22.453245Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:4299a05d5bc28eec4ee4367c93405f999a0a41f2a8f1a8d85885378dcdda2902","observation_id":"bbfcc725-c9e3-4758-b089-447b952957d2","resolution":{"observed_at":"2026-08-07T14:03:24.797890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:22.518133Z","title":"Is sora a world simulator? a comprehensive survey on general world models and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:22.518133Z"},"links":{"citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:bce32435e46cde04fd378151ad797549235320c7a35ea3dea5eedbc505e87f9a","observation_id":"d4934b74-e8b9-4767-9c49-d9d3fc886581","resolution":{"observed_at":"2026-08-07T14:03:22.518133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 13 inbound Pith citation observations for arXiv:2505.20171."}