{"as_of":"2026-08-20T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:900b5889952d6f6a98e89838f481cce0054836e0d0a668a02b467c64bb628a76","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:46.876113Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:43:37.510074Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:54:57.961666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-14T21:13:23.101760Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:f9b98ea691731b85ddf7aea5191fcc7dce33c27a41f512499592d7aefc66e9ec","observation_id":"85ed9549-5a85-4e0b-9220-f9468c6cb2a5","resolution":{"observed_at":"2026-05-19T05:17:06.579621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T22:36:31.044743Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2508.13009"},"observation_digest":"sha256:a5a390cb5713fd38f918b4643797d044b113de6c45a790c1cbd1b7eb412f9bf2","observation_id":"6fe79ce5-4e09-44a6-9f1a-f37ed8288403","resolution":{"observed_at":"2026-05-18T22:36:53.261124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-08-04T10:43:37.510074Z","title":"Playing with transformer at 30+ fps via next-frame diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09036","last_updated":"2026-06-24T10:18:59Z","snapshot_observed_at":"2026-08-17T04:24:58.976327Z","submitted_at":"2025-10-10T06:15:42Z","title":"RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:43:37.510074Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2510.09036"},"observation_digest":"sha256:c3bf74a30d40e25fbe49620aae5e33f672e780ae23152dacf07453eb08daee25","observation_id":"2b2e644a-d463-4e90-9339-514e08ab82df","resolution":{"observed_at":"2026-08-04T10:43:37.510074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2604.09527","last_updated":"2026-04-10T17:46:05Z","snapshot_observed_at":"2026-08-15T08:33:56.326008Z","submitted_at":"2026-04-10T17:46:05Z","title":"Envisioning the Future, One Step at a Time","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:41.904925Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2604.09527"},"observation_digest":"sha256:216315806e59adb8f2795f7356cb76ed33f71f195a66f6e86681cfc46532ac29","observation_id":"73a3b47d-225f-4037-bc31-628ccd0cdf46","resolution":{"observed_at":"2026-05-11T06:41:05.951388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-08-20T15:11:48.430991Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:ec2962a60f80da504e1415aa6bfecc81c3ffd36adc66cf69203f80c920eaee76","observation_id":"63b7fccf-b51d-41fe-a17e-679b03228f9c","resolution":{"observed_at":"2026-05-10T09:03:26.144191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-08-15T22:15:31.805489Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:19.111071Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:287ecbd23b8d0fe5e95c6c93da2b21a6715c7d2bbacac528a7c61f08b5b36dec","observation_id":"7f4661b4-163d-45c9-a1d4-182b8e7013ae","resolution":{"observed_at":"2026-05-21T05:29:39.422283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"cited_work":{"arxiv_id":"2506.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01380","snapshot_observed_at":"2026-06-30T17:54:57.961666Z","title":"Playing with transformer at 30+ fps via next-frame diffusion","venue":null,"work_id":"b4a52050-ad1f-471f-8888-68189511fba5","year":2025},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-08-15T22:15:31.805489Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T17:50:22.258541Z"},"links":{"cited_paper":"/paper/2506.01380","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:08c7ffde059f60797552aa250ce6579dd6cfd403a9c1ccd754dd79cc2f62e31e","observation_id":"304a5c1b-a27a-4192-b7c2-c58efde9de4b","resolution":{"observed_at":"2026-06-30T17:54:57.963353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01380/citation-record","integrity":"/paper/2506.01380/integrity","json":"/paper/2506.01380/citation-record.json","paper":"/paper/2506.01380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T11:49:41.669315Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.669315Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:14aca92e4d938227b3d3dd9adb170dc2bea292bf466285c9d0f18953c7e0e589","observation_id":"244b70f9-ebf8-4ce1-8757-fca7a6da178c","resolution":{"observed_at":"2026-08-07T11:49:41.669315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:41.724851Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.724851Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:eab1a3a7875953133d65c33313a112d5f49defac2e4e87065981fee3e2bab3a5","observation_id":"fb49a71e-b600-4a27-bc94-5c19ddb3f2af","resolution":{"observed_at":"2026-08-07T11:49:41.724851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:50.074258Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":"d4f3c274-7ddc-44ca-8ce6-4d2fa9ffc453","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.780871Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:09559984442b8197fc6a6d4d4faf06ee85a13bd3da077d5d8a68a40dec696b8f","observation_id":"01b31326-a147-4769-abcc-850662967b95","resolution":{"observed_at":"2026-08-07T11:49:50.211033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.909952Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":"dd142d74-adfd-4063-85be-d8e76de33a28","year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.831486Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:7d9034fe03346ac315310599a7ccee3fe5eeef01676f003fdd0009c3d473f36e","observation_id":"5052c2e3-eb6e-4d5b-ad36-2245576cd7ff","resolution":{"observed_at":"2026-08-07T11:49:49.982602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.729348Z","title":"Language models are few-shot learners","venue":null,"work_id":"93e5d34b-1315-48f1-8111-6fd0db256b9d","year":1901},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.879455Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:99f5e8cd80f46e7ea213b5241a215cf541b74e4511e1dce67b179c423f369a48","observation_id":"ed5dc038-8008-495b-86fb-10591f58257b","resolution":{"observed_at":"2026-08-07T11:49:49.811589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:41.967656Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:41.967656Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:fa7703220ee3c8f305cf3dd3c033c815e132ebfb3e257caf42b0954e791b78f5","observation_id":"0ec95660-fa27-44ff-895f-bd061699fefa","resolution":{"observed_at":"2026-08-07T11:49:41.967656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-07T11:49:42.051150Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.051150Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:07f396844583c835d308822b47a8aa200fa58fe4fad2ab2118d92d73465a8a53","observation_id":"d699f9dc-f578-41f3-9d70-722e4d6eaaa6","resolution":{"observed_at":"2026-08-07T11:49:42.051150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.114414Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.114414Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5d8f60cd63d246ae51dffc145ca67e58bf54a4ca78d5cb39a869bf589757085e","observation_id":"4419b65c-9ab0-42a4-971f-c21882a4a9c5","resolution":{"observed_at":"2026-08-07T11:49:42.114414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.153720Z","title":"Sana-sprint: One-step diffusion with continuous-time consistency distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.153720Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5832444b5c5941ab97148e71ad5328b885e0382687e95614f720d59542c6789b","observation_id":"4f067ec0-c780-4392-ad75-32d7e4a8449d","resolution":{"observed_at":"2026-08-07T11:49:42.153720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-08-16T13:08:25.687323Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-07T11:49:42.207829Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.207829Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2f00af38872f5c6f002acac54e387439958177e16eaeee37b92ae3f3f61f1c8f","observation_id":"794491b1-9a61-44bd-8399-e6d5650962a6","resolution":{"observed_at":"2026-08-07T11:49:42.207829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00433","last_updated":"2025-02-01T13:46:02Z","snapshot_observed_at":"2026-08-15T08:08:52.669892Z","submitted_at":"2025-02-01T13:46:02Z","title":"CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00433","snapshot_observed_at":"2026-08-07T11:49:42.283209Z","title":"Cat pruning: Cluster-aware token pruning for text-to-image diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.283209Z"},"links":{"cited_paper":"/paper/2502.00433","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:563f4975a1a620e3abf2a3338198604568bf26452fbdddd84b2750f2924d40dd","observation_id":"55a430e0-325c-4524-8c13-2f8e5b2eb418","resolution":{"observed_at":"2026-08-07T11:49:42.283209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.338890Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.338890Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c543fd9c16da398491134cc7b7b523d00c3f5b0622eaeeb44d55b9babef9f058","observation_id":"05958ecd-d84a-4b4a-8956-9ace4dfdf4f1","resolution":{"observed_at":"2026-08-07T11:49:42.338890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05636","last_updated":"2025-02-10T20:51:18Z","snapshot_observed_at":"2026-08-17T17:39:52.288109Z","submitted_at":"2024-08-10T21:24:25Z","title":"Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05636","snapshot_observed_at":"2026-08-07T11:49:42.399750Z","title":"Speculative diffusion decoding: Accelerating language generation through diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.399750Z"},"links":{"cited_paper":"/paper/2408.05636","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:50a22bf9e838ad474ed128f98e7036a4e6c8adb3c8d68690b88fa13c57e7fb86","observation_id":"614d844f-25fa-4288-b6c3-c257825fa05b","resolution":{"observed_at":"2026-08-07T11:49:42.399750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05370","last_updated":"2025-07-06T15:05:05Z","snapshot_observed_at":"2026-08-16T05:26:28.325566Z","submitted_at":"2025-01-09T16:50:16Z","title":"Accelerated Diffusion Models via Speculative Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05370","snapshot_observed_at":"2026-08-07T11:49:42.452683Z","title":"Accelerated diffusion models via speculative sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.452683Z"},"links":{"cited_paper":"/paper/2501.05370","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5a11857515304d9a4c498560c8d3f55f9034d61bb4f28e529532226dbc513806","observation_id":"5a8c4109-0bdf-4b38-b94a-da12a55010be","resolution":{"observed_at":"2026-08-07T11:49:42.452683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.523209Z","title":"Oasis: A universe in a transformer","venue":null,"work_id":"73449082-6951-4fc2-a9ce-a37fd58f7f62","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.512389Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:ce9ee7f7b508c35e172a80db373189a17878b8a39a1492bbbbea4b3c67ebbdab","observation_id":"98710a6b-25bd-40cd-8280-d7ecc15005d5","resolution":{"observed_at":"2026-08-07T11:49:49.594996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.552838Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.552838Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:efb246a20882276f6ebffb9c9293ac2a8a8e9e150219ebb046a66237634d70c6","observation_id":"555ffc70-71d1-4176-8a2d-8315aef0adf2","resolution":{"observed_at":"2026-08-07T11:49:42.552838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.628427Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.628427Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:a6699b10a1cf568ab7aee9a6d18c973928c9ffa8fefc1237fca3c7e8615ad867","observation_id":"7e9145c7-2721-4514-a17c-e447792d10fb","resolution":{"observed_at":"2026-08-07T11:49:42.628427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.677994Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.677994Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6feac29b4e8470941ed036642c8d2bb0f13ae1f373692b8a8f5093f36d8f7c95","observation_id":"896a152c-dc74-46c7-9765-1834df733d95","resolution":{"observed_at":"2026-08-07T11:49:42.677994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:42.727555Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.727555Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:ca8ac42077ba347461b326edae31823b727477f3848035a590992efe227aa1ff","observation_id":"9b5c2a66-effd-4e70-91f4-e9e926a1d3d7","resolution":{"observed_at":"2026-08-07T11:49:42.727555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.309666Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":"6faaea43-faef-4003-852d-95cc38dc7bac","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.792368Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:4ac2a67111ac9c2fcb33edcf7402d61247aca99582efcc4e5e07a3cf7af2f5af","observation_id":"25872947-c2bd-4564-9b4b-80de0aa5fc1c","resolution":{"observed_at":"2026-08-07T11:49:49.346082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-07T11:49:42.840907Z","title":"Long-context autoregressive video modeling with next-frame prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.840907Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:653163592df172868f6cf90ed40f956712bcddd37bc31173469c4579ba9b457c","observation_id":"4ba8dbc8-c918-4eb4-b0d6-ad4fea3cc9e3","resolution":{"observed_at":"2026-08-07T11:49:42.840907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08388","last_updated":"2025-04-11T09:41:04Z","snapshot_observed_at":"2026-08-16T12:42:04.838568Z","submitted_at":"2025-04-11T09:41:04Z","title":"MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08388","snapshot_observed_at":"2026-08-07T11:49:42.913195Z","title":"Mineworld: a real-time and open-source interactive world model on minecraft","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.913195Z"},"links":{"cited_paper":"/paper/2504.08388","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:14a51c82167cc9f723c1d924e7ebc6039f4321640d4d084860851a213cb23bff","observation_id":"92d671bb-a3a7-4acd-bea1-766cfceef618","resolution":{"observed_at":"2026-08-07T11:49:42.913195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-07T11:49:42.962948Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:42.962948Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:a99a0d73c92c13b22c9be23042a321f9ae6db28ab9fedc4c5ac377470fc9577f","observation_id":"84a16ecb-f50c-4525-9fb5-88aa4bc0fa82","resolution":{"observed_at":"2026-08-07T11:49:42.962948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T11:49:43.016848Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.016848Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:a1b1d4331b2867fc963003a37d9d860f1950627b0b99d4938716f4246930be7e","observation_id":"a041ef9d-72a0-4fe4-b8e4-6ee3aa4b97e1","resolution":{"observed_at":"2026-08-07T11:49:43.016848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T11:49:43.063242Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.063242Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:b41d5dce2db0224faf41e31cbd4d67d31cfb0f85c5e3302bbf33fe01adf12a0d","observation_id":"27b1f4b2-18df-4db5-91f1-8708ce935c74","resolution":{"observed_at":"2026-08-07T11:49:43.063242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:49.167229Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"762dede9-bc00-4eda-9dc7-c88f6583aa53","year":2020},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.103930Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:8bb71e400ce7b7d18b03143ff24a151101974a34c034917eac70405229a4fc3c","observation_id":"9b507f31-7b1a-4daf-ada6-45498c6f5a7b","resolution":{"observed_at":"2026-08-07T11:49:49.232940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-07T11:49:43.159204Z","title":"Gaia-1: A generative world model for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.159204Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c1e3f58868ff05857bdfbd9e85662de0ee482e7e673e0792b665f9b917ed96e2","observation_id":"8022c61b-1d09-4c0b-abe9-1a3830976dc7","resolution":{"observed_at":"2026-08-07T11:49:43.159204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.244093Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.244093Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:a44f42144afe5a126dd3b83d96d1beb72c1fee053154d43dce3d6d1e2f292af6","observation_id":"7eb626a3-f55d-4c06-b5b6-288a638f1d38","resolution":{"observed_at":"2026-08-07T11:49:43.244093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.969925Z","title":"Learning to simulate dynamic environments with gamegan","venue":null,"work_id":"4d306035-61ad-49d1-bbdd-77de2ee4f02f","year":2020},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.295706Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:29f08a9b6d9aa8cad779309cd539797165887660b924b87cc69f0ff8d8ca79ab","observation_id":"9b8a44f7-e077-45ec-9dc4-9a958dc95356","resolution":{"observed_at":"2026-08-07T11:49:49.072910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.344193Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.344193Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:ee671005d1eaaddba8d5c4d389257e732d80192adee74b9d94b82529c8dc20f7","observation_id":"f94f38e9-fc56-4ca3-9d86-bed4c5f7feca","resolution":{"observed_at":"2026-08-07T11:49:43.344193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.798256Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":"a849fe7c-7266-461b-96ea-1447878ae144","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.410746Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:dd47076cc3a4550fd2d19e2567e237886d791a8b13d10ea4c17ae40f4030f9c6","observation_id":"d457942c-d70c-44ed-a610-bb856991f381","resolution":{"observed_at":"2026-08-07T11:49:48.865142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T11:49:43.465981Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.465981Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6fd59a25d4fea13b6830e1634821a0191947892de4561f92442c1f45dcda6212","observation_id":"0f3acd39-c673-4d9f-bd75-efd65314df84","resolution":{"observed_at":"2026-08-07T11:49:43.465981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.547324Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.547324Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:b0bc7c4ebe8558551f470e2a9e61cdb1908a2c9d89bef5f0307c184fb026655e","observation_id":"831cc28a-985a-49d5-aeb2-ad88c629ebdd","resolution":{"observed_at":"2026-08-07T11:49:43.547324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.588354Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.588354Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:77c0883baacbe6340f1bed87a15cf2219e4fd65b7c9ad69bdc560e7247ed8b49","observation_id":"9a681093-c219-414d-bba4-996fb72b1165","resolution":{"observed_at":"2026-08-07T11:49:43.588354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.645431Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.645431Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:f6cec32520a4b51ad611e96e69824319f93f239841ac10b30a45cb4e1b5682aa","observation_id":"5a430c13-2701-412e-906a-22546058089c","resolution":{"observed_at":"2026-08-07T11:49:43.645431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.695257Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.695257Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:69461ffe79c866d741c9b38b561cad6455a6647279ef74049a65bf4ba4e0393f","observation_id":"cb3697ee-4b98-462b-a585-1e7d43bee3cc","resolution":{"observed_at":"2026-08-07T11:49:43.695257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-08-17T22:37:34.780172Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-07T11:49:43.757089Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.757089Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c718573990eabcf0591138bc4b30845af711b1e3480f8814f4d76e80ff2c5b2d","observation_id":"a127a3b0-bf61-42ad-bc05-c61bcf86d895","resolution":{"observed_at":"2026-08-07T11:49:43.757089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-08-18T13:49:48.200480Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-07T11:49:43.826343Z","title":"Dpm- solver++: Fast solver for guided sampling of diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.826343Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2c95f3c8ac14bda727477d62c3f1632bd57905df02a4ef54eb5c8c1e6f6a550a","observation_id":"064070d2-898e-499e-9c37-14aa8aba7101","resolution":{"observed_at":"2026-08-07T11:49:43.826343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.894267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.894267Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5ec87391a364cfd76dfe56f5f52ac76e4ed827ca0c9247036b0bddcdb4d49d49","observation_id":"6c9bea53-8c1e-4823-9143-fe3bebe56106","resolution":{"observed_at":"2026-08-07T11:49:43.894267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:43.972665Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:43.972665Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:99677144307a472b88f59aaddd0b2fb794f37532fcc543f9497fd195469eb94f","observation_id":"50e4430f-ac5a-49a2-a0ec-fcb87473229b","resolution":{"observed_at":"2026-08-07T11:49:43.972665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.051513Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.051513Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:ceea3d3a6caf55f495aff38e951cd9348d1e43f1513c1f4c58bd0791e4d320a7","observation_id":"997a0c0e-7b37-40d6-a318-66fe5816d0a3","resolution":{"observed_at":"2026-08-07T11:49:44.051513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T11:49:44.157194Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.157194Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:9904c3c65833c79a886f083cc29029208456f9298bd1808a260c393fef5e2aec","observation_id":"36275562-bb18-48f9-bcf3-fcbefeaf1c6f","resolution":{"observed_at":"2026-08-07T11:49:44.157194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.282569Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.282569Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:752fb2352a3e6938403eee633dc9f5de15c0629a9faee2372916192174e29694","observation_id":"d3a2258f-eda7-4680-9303-375ca7af16d0","resolution":{"observed_at":"2026-08-07T11:49:44.282569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-08-12T12:54:06.280248Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-07T11:49:44.373058Z","title":"Gaia-2: A controllable multi-view generative world model for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.373058Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:1f07b72e7b42fa551f8b12e3bcef10c322e2cbf02278cbbd933dbd0be49451d0","observation_id":"758a92ba-c5cf-4ec5-bd22-2dad472cd609","resolution":{"observed_at":"2026-08-07T11:49:44.373058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-07T11:49:44.482801Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.482801Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:ef33b2c313df86faa4c802bb295be934f051dc19c22def0551ebd9fdd9ceb01c","observation_id":"7ea15702-e171-45c5-b4bd-5e1ffcb05278","resolution":{"observed_at":"2026-08-07T11:49:44.482801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.524806Z","title":null,"venue":null,"work_id":"643ccd62-7155-44b8-9dc7-f7c374882765","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.610609Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:da7657eea4dc93660941434c5bf6f01760d7e44f1f2bba093609d91e519329e4","observation_id":"3afca255-798f-4e8b-93f6-76d4ff56c7fd","resolution":{"observed_at":"2026-08-07T11:49:48.625980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.715413Z","title":"Mastering atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.715413Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c1490f531e110b4f3152340e44863013f377fe588cf0e52b48ae35d75489d658","observation_id":"9014dacf-a4df-4dd1-abe8-536867e34a55","resolution":{"observed_at":"2026-08-07T11:49:44.715413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:44.809000Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.809000Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:93ea445810e1bc6891b5cd32b3272d0c45b0869826eabb96f87e1e47a5da8cb6","observation_id":"4139b3eb-4354-4a14-897b-c21ada20b60c","resolution":{"observed_at":"2026-08-07T11:49:44.809000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T11:49:44.911941Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.911941Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:acbca24130ca7cf6fbf1a9a28a1562885378f0fd258a177b8463b1010047098b","observation_id":"669706dd-e7f9-4c9b-a152-c74416627bd0","resolution":{"observed_at":"2026-08-07T11:49:44.911941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:45.039508Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.039508Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:e1739f18eeaedc38b73655da7d5fe53db2f1589adf75a1cf18c5afd32e189f2f","observation_id":"4b69d8d2-a957-404b-bce3-5b9631ea15e5","resolution":{"observed_at":"2026-08-07T11:49:45.039508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13061","last_updated":"2024-12-17T16:27:11Z","snapshot_observed_at":"2026-08-20T06:25:34.778135Z","submitted_at":"2024-12-17T16:27:11Z","title":"VidTok: A Versatile and Open-Source Video Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13061","snapshot_observed_at":"2026-08-07T11:49:45.159313Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.159313Z"},"links":{"cited_paper":"/paper/2412.13061","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:7b6aecfab896ce11c8bb3490596e29d96f0fc588d2525ffb0a992c5c96337147","observation_id":"ef69d201-f105-4960-bf9c-554ac4c7e766","resolution":{"observed_at":"2026-08-07T11:49:45.159313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:49:45.258191Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.258191Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5b6f5960d0b584e8b6f06c3616163c07c541f10a8b11f67be5dd9ff565c11a4c","observation_id":"82f4af78-8928-40ad-8d5b-fe5b1a6d6a93","resolution":{"observed_at":"2026-08-07T11:49:45.258191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T11:49:45.338761Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.338761Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:1451594058a5d56ee6a4b541fddeeb2357f51f337c8c9ac2183fd4627651b26d","observation_id":"8df5ef5d-437e-44bd-80e9-3c2672772843","resolution":{"observed_at":"2026-08-07T11:49:45.338761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-20T13:26:59.131257Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T11:49:45.459923Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.459923Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:59431969f039c757ed589b8424684abfa428bc3435b681e6e7bf8dbd53229f00","observation_id":"a15bba91-5386-4aaa-bd82-07dc7b2dfcff","resolution":{"observed_at":"2026-08-07T11:49:45.459923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10445","last_updated":"2025-04-17T16:05:20Z","snapshot_observed_at":"2026-08-16T14:00:32.725718Z","submitted_at":"2024-04-16T10:31:06Z","title":"SparseDM: Toward Sparse Efficient Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10445","snapshot_observed_at":"2026-08-07T11:49:45.587972Z","title":"Sparsedm: Toward sparse efficient diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.587972Z"},"links":{"cited_paper":"/paper/2404.10445","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:61bb8914cec9ea7e12cf9c7b722cb1c5438fb62c9210b76f853de8be11f7a728","observation_id":"a71b5ed8-f426-4118-bc98-ee61850d411f","resolution":{"observed_at":"2026-08-07T11:49:45.587972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:45.688193Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.688193Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:ba645a6ab2fc9d290d79f3ade1a800550d71393debb28938051e136374e5648e","observation_id":"de718956-e0a8-4e10-ac15-e6ff202e9df5","resolution":{"observed_at":"2026-08-07T11:49:45.688193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:45.793677Z","title":"ivideogpt: Interactive videogpts are scalable world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.793677Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:82129a4c2b686e76dda8a2d5c217851a81467dad925a8dcb6571cb7fdbe7289a","observation_id":"944b68fc-c7cf-41f4-a0b2-7e15d97f381f","resolution":{"observed_at":"2026-08-07T11:49:45.793677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.317497Z","title":"Structured 3d latents for scalable and versatile 3d generation","venue":null,"work_id":"0e61bf29-68ea-4232-aa90-380caf59a01d","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:45.891921Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6c5d7b4e51dac095c54208d7ebc53ac019de8e7513609fc6af77362905d7a373","observation_id":"5867bbd9-0c42-4daa-9eea-7c3cdbca4bb9","resolution":{"observed_at":"2026-08-07T11:49:48.368033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:49:46.038383Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.038383Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:92becb9fbe109ee1ecf069ac7031981a0a37fac8e4f4d5362100119983e6c1d7","observation_id":"006165f0-d22d-45b4-9a01-8dac9f634583","resolution":{"observed_at":"2026-08-07T11:49:46.038383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.094491Z","title":"Learning interactive real-world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.094491Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:38cd82eff14f2c09c00ef2ccf69342105fb78af04e88e1e7faff040c929e441f","observation_id":"0e869d7d-1207-4229-9ba0-c76a48058a43","resolution":{"observed_at":"2026-08-07T11:49:46.094491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T11:49:46.205356Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.205356Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:d308868247cc309528ce4f88032a0413a273178588b8b81d446bf3a8521e580b","observation_id":"76a209fa-6616-4f33-a3b4-a610861537af","resolution":{"observed_at":"2026-08-07T11:49:46.205356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.325346Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.325346Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:c3ed8b1df9ea95977b72951dc31e3abca87eef22219e93e0348aa6cd77b3259e","observation_id":"3679763c-168a-4206-98dc-f77eea973d1c","resolution":{"observed_at":"2026-08-07T11:49:46.325346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.430341Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.430341Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:76970175f0b547dfff36d2eb2f36405bd2e59c56e5e6de5960932b655f7fbb81","observation_id":"595a32b9-49df-4289-9282-8ed39999edc2","resolution":{"observed_at":"2026-08-07T11:49:46.430341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09645","last_updated":"2025-08-20T18:39:27Z","snapshot_observed_at":"2026-08-17T07:28:36.727676Z","submitted_at":"2024-12-10T18:52:39Z","title":"Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09645","snapshot_observed_at":"2026-08-07T11:49:46.509630Z","title":"Evaluation agent: Effi- cient and promptable evaluation framework for visual generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.509630Z"},"links":{"cited_paper":"/paper/2412.09645","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:2d71fa305fd47efa222f18149355d77943c7f5d379d9d8bdb47cca437a66c6d6","observation_id":"fdf71b7a-fb16-4023-b770-e1a77b564d81","resolution":{"observed_at":"2026-08-07T11:49:46.509630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:48.115431Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"702cf254-9438-41f4-a979-999425054a2c","year":2018},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.632889Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:fe8be9969b3ed7614ee0869362439d323f54ca9bbe278f555041951283080815","observation_id":"3cf5599f-d2c9-4bae-95ac-a89b1cab702f","resolution":{"observed_at":"2026-08-07T11:49:48.182571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:47.966528Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video gen- eration","venue":null,"work_id":"843abbba-b3f4-471b-844e-ba8531ec8595","year":2025},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.727368Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:5d3682f2c29fac5af01619c07e70af80b98cdcc103281840f091ef808bcfa2cd","observation_id":"9653b660-e1e2-4245-9f08-35784f3d887a","resolution":{"observed_at":"2026-08-07T11:49:48.009638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:46.822591Z","title":"Genad: Gen- erative end-to-end autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.822591Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:68e6cf4c3f54c861d43c7c0c7103b6aa24e7a236d3500e33afc0f508abbde027","observation_id":"d75d06a7-22a2-4eef-add7-1fb68169bf7b","resolution":{"observed_at":"2026-08-07T11:49:46.822591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:47.810280Z","title":"\"\" model : Distilled NFD + model vid : Input video tensor act : Action sequence tensor","venue":null,"work_id":"d4e4c026-f184-4dbe-9b76-305857c1286b","year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.876113Z"},"links":{"citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:6bf7d3081e9ccd520364982a0420656e98b43840b20e94a62a5d7a517e557357","observation_id":"2bba489d-707c-40e4-b46a-73d633d75228","resolution":{"observed_at":"2026-08-07T11:49:47.872390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 7 inbound Pith citation observations for arXiv:2506.01380."}